1SemComp-Bench: Benchmarking Semantic Task Completion in Video GenerationSemComp-Bench:视频生成中语义任务完成度的基准测试SemComp-Bench: 動画生成における意味的タスク達成度のベンチマーク151 UPVOTES · KEYU TU ET AL. · FRAMEX-AI · ARXIV 2608.17426SemComp-Bench recasts video generation as an outcome-oriented task: a clip counts as a success only if it reaches the intended result and stays semantically grounded in the reference image. Evaluation judges the generated outcome rather than demanding a complete sequence of intermediate steps or conventional appearance consistency. It is the most upvoted paper on Hugging Face today with 151 votes.SemComp-Bench 把视频生成重新定义为面向结果的任务:只有当生成片段达成预期结果、并在语义上与参考图像保持对应时才算成功。评测只考察生成的最终结果,而不要求呈现完整的中间步骤序列或传统意义上的外观一致性。该论文以 151 票成为今天 Hugging Face 上得票最高的一篇。SemComp-Bench は動画生成を結果志向のタスクとして捉え直す。意図した成果に到達し、かつ参照画像と意味的に対応している場合にのみ成功とみなす。評価は生成された成果そのものを見るもので、中間手順の完全な系列や従来型の見た目の一貫性は求めない。本日の Hugging Face で最多となる 151 票を集めた。
2OmniScientist: An Omni-Modal Omni-Discipline AI ScientistOmniScientist:全模态、跨学科的 AI 科学家OmniScientist: 全モーダル・全分野に対応する AI サイエンティスト83 UPVOTES · BOBO LI ET AL. · NATIONAL UNIVERSITY OF SINGAPORE · ARXIV 2608.13558OmniScientist is an end-to-end AI scientist that runs multidisciplinary research across modalities instead of reasoning only over text, code, labels or precomputed summaries. The authors argue that existing systems leave out the spatial, temporal, cross-channel and procedural relations that scientific discovery actually turns on, so workflow coverage alone is not enough.OmniScientist 是一个端到端的 AI 科学家系统,跨模态开展多学科研究,而不是仅在文本、代码、标签或预先汇总的结果上做推理。作者认为现有系统遗漏了科学发现真正依赖的空间、时间、跨通道与流程性关系,因此仅覆盖完整工作流并不足够。OmniScientist は、テキストやコード、ラベル、事前に要約された情報だけで推論するのではなく、複数のモダリティにまたがって多分野の研究を行うエンドツーエンドの AI サイエンティストである。著者らは、既存システムが科学的発見の鍵となる空間的、時間的、チャネル横断的、手続き的な関係を取りこぼしており、ワークフローを網羅するだけでは不十分だと主張する。
3SPADE: Self-Play in Adaptive Synthetic Executable EnvironmentsSPADE:在自适应合成可执行环境中的自博弈SPADE: 適応的な合成実行環境における自己対戦40 UPVOTES · BO LIU ET AL. · SPADE-RL · ARXIV 2608.19197SPADE is a self-play reinforcement learning framework in which one language model takes two roles: an Environment Designer that writes long-horizon training environments as executable code behind a Gym-style reset and step interface, and a Reasoning Agent that learns inside them. The aim is a goal distribution that keeps expanding as the learner scales, which hand-curated or frozen environment pools cannot do.SPADE 是一个自博弈强化学习框架,由同一个语言模型扮演两种角色:环境设计者把长程训练环境写成可执行代码,并暴露 Gym 风格的 reset 与 step 接口;推理智能体则在其中学习。其目标是让任务分布随学习者一同扩展,而人工整理或固定不变的环境池做不到这一点。SPADE は、一つの言語モデルが二つの役割を担う自己対戦型の強化学習フレームワークである。環境デザイナーは長期的な訓練環境を Gym 形式の reset と step を備えた実行可能コードとして記述し、推論エージェントはその中で学習する。狙いは、人手で整えた環境や固定された環境群では実現できない、学習者の規模に応じて広がり続ける目標分布を得ることにある。
4Training Chemical Plausibility-Aware Large Language Models for Single-Step Retrosynthesis训练具备化学合理性判断的大语言模型用于单步逆合成単一ステップ逆合成のための化学的妥当性を考慮した大規模言語モデルの訓練29 UPVOTES · BOGDAN ZAGRIBELNYY ET AL. · INSILICO MEDICINE · ARXIV 2608.18940Insilico Medicine trained C3LM, a chemistry model for single-step retrosynthesis, on a dataset of roughly 45.6 million verified reactions. The team proposes Top-K prompting to capture the intrinsically one-to-many nature of the problem, which single-answer benchmarks measure poorly, and pairs fine-tuning with plausibility and novelty rewards.Insilico Medicine 用约 4560 万条经过验证的反应数据训练了化学模型 C3LM,用于单步逆合成。团队提出 Top-K 提示方法,以刻画该问题固有的一对多特性——这正是单一答案式评测难以衡量的部分——并将微调与合理性、新颖性奖励结合起来。Insilico Medicine は、検証済みの反応およそ 4560 万件からなるデータセットで、単一ステップ逆合成向けの化学モデル C3LM を訓練した。単一の正解を前提とするベンチマークでは測りにくい一対多の性質を捉えるため Top-K プロンプティングを提案し、ファインチューニングに妥当性と新規性の報酬を組み合わせている。
5EDITBRIDGE: Towards Faithful and Efficient Ultra-High-Resolution Image EditingEDITBRIDGE:面向忠实且高效的超高分辨率图像编辑EDITBRIDGE: 忠実かつ効率的な超高解像度画像編集に向けて21 UPVOTES · JIAYI SONG ET AL. · ARXIV 2608.18063EDITBRIDGE targets image editing above 1K resolution, where quadratic attention cost and memory push most diffusion models into a two-stage workaround: edit small, then upscale. The authors say that pipeline hallucinates details contradicting the high-resolution source and leaves texture over-smoothed or over-sharpened, and propose editing at full resolution instead.EDITBRIDGE 面向 1K 以上分辨率的图像编辑。由于注意力计算量随分辨率平方增长且显存开销高昂,多数扩散模型只能采用两段式变通方案:先低分辨率编辑,再单独超分。作者指出这一流程会臆造出与高分辨率原图相矛盾的细节,并使纹理过度平滑或过度锐化,因此主张直接在原始分辨率上编辑。EDITBRIDGE は 1K を超える解像度での画像編集を対象とする。注意機構の計算量が解像度の二乗で増え、メモリ要求も大きいため、多くの拡散モデルは低解像度で編集してから超解像するという二段構えに頼っている。著者らは、この方式が高解像度の元画像と矛盾する細部を生み、テクスチャが過度に平滑化または先鋭化されると指摘し、元の解像度のまま編集する方法を提案する。
2026-08-19 · WEDNESDAY · 13:05 PDT
1Demystifying Agent Skills: Why They Work-Until They Don't解构 Agent Skills:它们为何有效,又在何处失效エージェントスキルの解明: なぜ機能し、どこで機能しなくなるのか102 UPVOTES · ZHIYUAN JIANG ET AL. · UNIVERSITY OF CALIFORNIA AT SAN DIEGO · ARXIV 2608.14036A UC San Diego team ran controlled experiments to isolate when skills actually help LLM agents and when they fail. The study varies representation, outcome annotation, retrieval difficulty and cross-framework robustness across several benchmarks, agent harnesses and models. It argues aggregate task-success numbers hide where skills break down.加州大学圣迭戈分校的团队通过受控实验,厘清技能(skills)在何时真正提升 LLM 智能体表现、又在何时失效。研究在多个基准、智能体框架与模型上分别考察了表示方式、结果标注、检索难度与跨框架稳健性的影响。作者认为,仅看任务成功率的汇总数字会掩盖技能失效的具体位置。カリフォルニア大学サンディエゴ校のチームが、スキルがLLMエージェントを本当に助けるのはいつで、失敗するのはどこかを制御実験で切り分けた。複数のベンチマーク、エージェントハーネス、モデルにわたり、表現方法、結果アノテーション、検索の難易度、フレームワーク間の頑健性を個別に変化させて検証している。集計されたタスク成功率では破綻箇所が見えないと論じる。
2Agentic ESOpt: Fine-Tuning Long-Horizon LLM Agents with Minimal GPU RequirementsAgentic ESOpt:以极低 GPU 需求微调长时程 LLM 智能体Agentic ESOpt: 最小限のGPUで長期タスクのLLMエージェントを微調整する90 UPVOTES · ZHI ZHENG ET AL. · NATIONAL UNIVERSITY OF SINGAPORE · ARXIV 2608.17310Researchers at the National University of Singapore argue for evolution strategies over reinforcement learning when fine-tuning long-horizon LLM agents. They say ES avoids the heavyweight backpropagation stack that keeps RL from scaling to larger models, and sidesteps the credit-assignment problem that branching, sparsely rewarded trajectories create.新加坡国立大学的研究者主张,在微调长时程 LLM 智能体时,进化策略(ES)比强化学习更合适。他们指出,ES 无需强化学习那套依赖反向传播的重型训练栈,因而可扩展到更大的模型,同时也绕开了分支繁多、奖励稀疏的轨迹所带来的信用分配难题。シンガポール国立大学の研究者らは、長期タスクを担うLLMエージェントの微調整には強化学習より進化戦略(ES)が適していると主張する。ESは逆伝播に依存する重い学習スタックを必要としないため大規模モデルにも適用でき、分岐が多く報酬の疎な軌跡で生じる信用割当の問題も回避できるとしている。
3Embodied-Navigator: Point, Think, Memorize, and Align for Efficient NavigationEmbodied-Navigator:以指点、思考、记忆与对齐实现高效导航Embodied-Navigator: 指し示し、考え、記憶し、整合させる効率的なナビゲーション43 UPVOTES · HONGYAN FENG ET AL. · ZJU-OMNIAI · ARXIV 2608.17512A ZJU-OmniAI team introduces TAMP-Nav, which recasts embodied navigation as 2D visual prompting so a vision-language model only has to select pixels. The formulation avoids the unnatural action spaces that clash with a VLM's 2D pre-training priors, and pairs it with more flexible reasoning schedules and memory management.ZJU-OmniAI 团队提出 TAMP-Nav,将具身导航重构为二维视觉提示任务,使视觉语言模型只需选择像素点即可。该形式化避免了与 VLM 二维预训练先验相冲突的非自然动作空间,并配以更灵活的推理调度与记忆管理机制。ZJU-OmniAIのチームはTAMP-Navを提案し、身体性ナビゲーションを2次元の視覚プロンプトとして定式化することで、視覚言語モデルはピクセルを選ぶだけでよくなる。この設計はVLMの2次元事前学習の事前知識と衝突する不自然な行動空間を避け、柔軟な推論スケジュールと記憶管理を組み合わせる。
4AVA-Encoder: Towards Agent-Native Video Representation LearningAVA-Encoder:面向智能体原生的视频表征学习AVA-Encoder: エージェントネイティブな動画表現学習に向けて35 UPVOTES · CHUYUE LI ET AL. · QWEN BUSINESS UNIT · ARXIV 2608.12313The Qwen Business Unit proposes AVA-Encoder, which converts a video into a knowledge-graph representation and then reconstructs the video from it. The agentic auto-encoding setup aims to give creative agents a structure they can reason over and manipulate, rather than an opaque latent, so they can learn from high-quality human films.Qwen 业务部门提出 AVA-Encoder,先把视频转换为知识图谱表示,再由该表示重建出视频。这种“智能体式自编码”旨在为创作类智能体提供可推理、可操作的结构,而非不透明的隐空间表示,从而让它们能够从高质量的人类影片中学习。Qwenビジネスユニットは、動画をナレッジグラフ表現に変換し、そこから動画を再構成するAVA-Encoderを提案した。このエージェント的オートエンコーディングは、不透明な潜在表現ではなく推論・操作が可能な構造を創作エージェントに与え、質の高い人間の映像作品から学べるようにすることを狙う。
5An Empirical Study of Training Pixel-Space Text-to-Image Diffusion Models像素空间文生图扩散模型训练的实证研究ピクセル空間でのテキスト画像生成拡散モデル学習に関する実証研究30 UPVOTES · DENGYANG JIANG ET AL. · TONGYI-MAI · ARXIV 2608.16887Tongyi-MAI reports a large-scale study of text-to-image diffusion trained directly in pixel space rather than in a latent space. The authors find that direct pixel-space pre-training converges substantially more slowly at scale, and propose a latent-to-pixel strategy that acquires the representation in latent space first.Tongyi-MAI 发布了一项关于直接在像素空间(而非隐空间)训练文生图扩散模型的大规模实证研究。作者发现,大规模直接在像素空间预训练的收敛速度明显更慢,并据此提出先在隐空间获得表征、再迁移到像素空间的“隐空间到像素”策略。Tongyi-MAIは、潜在空間ではなくピクセル空間で直接学習するテキスト画像生成拡散モデルの大規模な実証研究を報告した。著者らは、大規模な事前学習をピクセル空間で直接行うと収束が大幅に遅くなることを見いだし、まず潜在空間で表現を獲得する「潜在からピクセルへ」の戦略を提案している。
2026-08-18 · TUESDAY · 13:07 PDT
1HarnessEval-W: Agentifying the Evaluation of Visual WorldsHarnessEval-W:将视觉世界的评测智能体化HarnessEval-W: 視覚世界の評価のエージェント化109 UPVOTES · WEILIANG CHEN ET AL. · MIRROS · ARXIV 2608.16859HarnessEval-W is an evaluation pipeline that judges world model rollouts with an agent harness instead of brute-force metrics. It produces a reasoning chain justifying each score, so violations of physics, causality and world state can be examined and verified rather than reduced to a scalar. It is the day's most upvoted paper at 109 votes.HarnessEval-W 是一套评测流程,用智能体 harness 而非暴力计算的指标来判定世界模型的推演结果。它为每个分数生成可供检验的推理链,使物理、因果与世界状态上的破绽能够被审查和验证,而不是被压缩成一个标量分数。该论文以 109 票成为当日票数最高的一篇。HarnessEval-W は、ワールドモデルのロールアウトを総当たり的な指標ではなくエージェントのハーネスで評価するパイプラインである。各スコアの根拠となる推論の連鎖を出力するため、物理・因果・世界状態の破綻をスカラー値に還元せず検証できる。本日最多となる109票を集めた。
2StateM: Reaching 95.3% Raw Accuracy, or a $15 Frontier Run, on Terminal-Bench 2.1 via Harness ScalingStateM:通过 harness 扩展在 Terminal-Bench 2.1 上达到 95.3% 原始准确率,或 15 美元的前沿运行StateM: ハーネススケーリングによるTerminal-Bench 2.1での95.3%の生正答率、あるいは15ドルのフロンティア実行51 UPVOTES · ZIHENG QIN ET AL. · ARXIV 2608.15089StateM is an agent-native runtime that organizes long-horizon execution around durable states, phase-local context, checked transitions and recoverable runbooks, leaving model weights untouched. The authors report 95.3 percent raw accuracy on Terminal-Bench 2.1 and a frontier run costing 15 dollars, framing it as a case for scaling the harness rather than the model.StateM 是一个面向智能体的运行时,围绕持久状态、阶段局部上下文、受检的状态转移和可恢复的操作手册来组织长程执行,且不改动模型权重。作者报告其在 Terminal-Bench 2.1 上取得 95.3% 的原始准确率,一次前沿运行成本为 15 美元,并以此论证应当扩展 harness 而非扩展模型。StateM は、永続的な状態、フェーズ局所のコンテキスト、検査付きの遷移、復旧可能なランブックを軸に長期タスクの実行を組み立てるエージェント向けランタイムで、モデルの重みは変更しない。著者らは Terminal-Bench 2.1 で95.3%の生の正答率と15ドルのフロンティア実行を報告し、モデルではなくハーネスを拡張する立場を示している。
3Large Discovery Models: Empirically-grounded Model-Based Open-Ended Search大型发现模型:基于实证的模型驱动开放式搜索大規模ディスカバリーモデル: 実証に基づくモデルベースの開放的探索48 UPVOTES · ZHONGWEI YU ET AL. · YANGTZE-AILAB · ARXIV 2608.15669The Large Discovery Model is a recurrent architecture for open-ended search over structured hypothesis spaces such as molecules, protein sequences and programs, where each candidate is expensive to evaluate. The authors argue that language model likelihoods and self-assessments are unreliable proxies for the objective and for calibrated uncertainty, and ground the search empirically instead.Large Discovery Model 是一种循环架构,用于在分子、蛋白质序列和程序等结构化且开放的假设空间中搜索,这类空间中每个候选的评估成本都很高。作者认为语言模型的似然与自评并不能可靠代表目标函数或校准后的不确定性,因而改用实证数据来支撑搜索。Large Discovery Model は、分子・タンパク質配列・プログラムといった構造化された開放的な仮説空間を探索する再帰型アーキテクチャで、候補ごとの評価コストが高い設定を対象とする。著者らは、言語モデルの尤度や自己評価は目的関数や較正された不確実性の代理として信頼できないとし、実証データに基づく探索を提案する。
4Learn What's Left, Not What's Mastered: Saturation Aware Advantage Reweighting for Multi-Reward Policy Optimization学尚未掌握的,而非已经掌握的:面向多奖励策略优化的饱和感知优势重加权習得済みではなく残されたものを学ぶ: 多目的報酬の方策最適化に向けた飽和認識型アドバンテージ再重み付け43 UPVOTES · YIXUAN WANG ET AL. · UNIVERSITY OF CALIFORNIA AT SAN DIEGO · ARXIV 2608.16072The paper targets multi-reward reinforcement learning for post-training reasoners, where reward vectors are usually collapsed into a fixed weighted sum before group-wise standardization. The authors show this hands identical advantages to rollouts with different reward profiles and keeps spending gradient on objectives that are already saturated.该论文针对推理模型后训练中的多奖励强化学习:现有做法通常先把奖励向量按固定权重求和,再做组内标准化。作者指出,这会让奖励构成完全不同的采样获得相同的优势值,并持续把梯度花在已经饱和的目标上。本論文は、推論モデルの事後学習における多目的報酬の強化学習を扱う。従来手法は報酬ベクトルを固定重みで加算してからグループ内で標準化するため、報酬の内訳が異なるロールアウトに同一のアドバンテージが与えられ、すでに飽和した目的にも勾配が費やされ続けると著者らは指摘する。
5MOSS-VL Technical ReportMOSS-VL 技术报告MOSS-VL テクニカルレポート38 UPVOTES · PENGYU WANG ET AL. · OPENMOSS · ARXIV 2608.15045OpenMOSS released MOSS-VL, an open vision-language model family designed to perceive while it speaks. The language decoder attends to vision only through gated cross-attention, so incoming frames can be handled during generation, and a synthesized interaction corpus supervises when to speak, stay silent or revise. Real-time training sits in one light final stage over an offline foundation.OpenMOSS 发布了开源视觉语言模型系列 MOSS-VL,把边看边说的实时交互作为一等能力来设计。语言解码器仅通过门控交叉注意力接入视觉,因而可以在生成过程中处理新到的画面;合成的交互语料则监督模型何时开口、何时沉默、何时修正。实时相关的训练集中在离线基座之上的最后一个轻量阶段。OpenMOSS は、話しながら見るリアルタイム対話を第一級の機能として設計したオープンな視覚言語モデル群 MOSS-VL を公開した。言語デコーダはゲート付きクロスアテンションのみで視覚を参照するため、生成中に届くフレームを処理できる。合成した対話コーパスが、話す・黙る・言い直すタイミングを教師信号として与える。
2026-08-17 · MONDAY · 13:06 PDT
1Self-Supervised Visual On-Policy Distillation自监督的视觉在线策略蒸馏自己教師あり視覚オンポリシー蒸留144 UPVOTES · YIJIANG LI ET AL. · UNIVERSITY OF CALIFORNIA AT SAN DIEGO · ARXIV 2608.14144The paper asks where the teacher-student asymmetry in visual on-policy distillation can come from when no privileged supervision is available. Instead of handing the teacher extra information such as reference answers or ground-truth regions of interest, the authors subtract information from the student, which they report yields the same effective learning signal for free.论文提出的问题是:当没有任何特权监督信号可用时,视觉在线策略蒸馏所依赖的师生信息不对称从何而来。作者不再向教师模型追加参考答案或真值感兴趣区域等额外信息,而是反过来削减学生模型可获得的信息,并称这样能够免费获得同等有效的学习信号。本論文は、特権的な教師信号が一切ない状況で、視覚オンポリシー蒸留に必要な教師と生徒の非対称性をどこから得るかを問う。著者らは参照解答や正解の注目領域といった追加情報を教師に与えるのではなく、逆に生徒から情報を差し引くことで、同等の学習信号をコストなしに得られると報告している。
2Apodex Discovery: Reality Benchmarks and Environments for Evaluating and Building Discoverative Artificial IntelligenceApodex Discovery:面向发现型人工智能的评估与构建的现实基准与环境Apodex Discovery: 発見型人工知能を評価・構築するための現実ベンチマークと環境22 UPVOTES · BRIAN WANG ET AL. · APODEX · ARXIV 2608.11341Apodex Discovery is a framework of benchmarks and environments for AI aimed at open-ended discovery rather than pre-specified tasks, built around what the 29 authors call a heavy-duty solver. Their argument is that frontier models already handle hard problems once the goal, tools and success criteria are executable, and the missing step is turning real-world challenges into that form.Apodex Discovery 是一套面向开放式发现(而非预先设定任务)的 AI 基准与环境框架,核心是 29 位作者所称的 heavy-duty solver。他们的论点是:一旦目标、工具与成功标准可被执行和验证,前沿模型已能解决困难问题,真正缺失的一步是把现实世界的挑战转化为这种可执行的形式。Apodex Discovery は、あらかじめ規定されたタスクではなく開かれた発見を対象とする AI のためのベンチマークと環境の枠組みで、29 名の著者が heavy-duty solver と呼ぶ仕組みを中核に据える。目標・ツール・成功基準が実行可能な形になれば最先端モデルは難問を解けており、欠けているのは現実の課題をその形に変換する工程だ、というのが主張である。
3Marionette: Predicting World States, Rendering Geometry, Painting AppearanceMarionette:预测世界状态、渲染几何、绘制外观Marionette: 世界状態の予測、ジオメトリのレンダリング、外観の描画22 UPVOTES · ZIAN MENG ET AL. · ARXIV 2608.14530Marionette splits an interactive game world model into three jobs: predicting the evolving world state, computing geometry with a fixed zero-parameter renderer, and leaving the neural network to synthesize appearance. The design targets long-horizon drift, where models that autoregress pixels or latents accumulate errors in pose, geometry and occlusion until control breaks down.Marionette 把交互式游戏世界模型拆成三件事:预测不断演化的世界状态、由固定的零参数渲染器计算几何、再交给神经网络合成外观。该设计针对的是长时程漂移问题:直接对像素或隐变量做自回归的模型会不断累积姿态、几何和遮挡上的误差,最终导致可控性崩坏。Marionette は、インタラクティブなゲーム世界モデルを三つの役割に分解する。変化する世界状態の予測、パラメータを持たない固定レンダラーによるジオメトリ計算、そしてニューラルネットワークによる外観の合成である。狙いは長期的なドリフトの抑制で、ピクセルや潜在表現を自己回帰する方式では姿勢・幾何・遮蔽の誤差が蓄積し、制御が破綻していく。
4DFM Mimir v1: An Open HRM Delivering Frontier Performance at 1B Parameters Using Only Permissible Post-Training DataDFM Mimir v1:仅用可授权后训练数据、在 10 亿参数上实现前沿性能的开放 HRMDFM Mimir v1: 許諾されたポストトレーニングデータのみで10億パラメータのフロンティア性能を実現するオープンHRM21 UPVOTES · PETER SCHNEIDER-KAMP ET AL. · UNIVERSITY OF SOUTHERN DENMARK (SDU) · ARXIV 2608.13517Mimir v1 is a 1-billion-parameter model built on the Hierarchical Reasoning Model architecture and trained from scratch on a mixture of 161 permissibly licensed datasets. It outperforms the original HRM-Text 1B and sets a new state of the art for Danish, which the authors offer as evidence that ethically sourced data need not forfeit competitive results at this scale.Mimir v1 是一个基于分层推理模型(HRM)架构的 10 亿参数模型,完全从零开始训练,使用了 161 个具备合规授权的数据集组成的混合语料。它的表现优于原始的 HRM-Text 1B,并在丹麦语上刷新了最好成绩;作者以此说明,在这一参数规模上,坚持合规取得的数据并不意味着放弃有竞争力的效果。Mimir v1 は階層的推論モデル(HRM)アーキテクチャに基づく 10 億パラメータのモデルで、利用許諾の明確な 161 のデータセットを混合したコーパスでゼロから学習された。オリジナルの HRM-Text 1B を上回り、デンマーク語では新たな最高性能を記録しており、著者らはこの規模であれば倫理的に調達したデータでも競争力を犠牲にしないことの証拠だとしている。
5CPI-Bench: A Comprehensive, Practical and Intelligent Benchmark for Real-World Image EditingCPI-Bench:面向真实场景图像编辑的综合、实用与智能基准CPI-Bench: 実世界の画像編集に向けた包括的・実用的で知的なベンチマーク12 UPVOTES · QINYE ZHOU ET AL. · ALIBABA · ARXIV 2608.14546CPI-Bench is an image editing benchmark built for deployment-like conditions, covering multi-image edits, demanding reasoning instructions and practical settings. The 20 authors argue that existing benchmarks stay confined to simple single-image tasks, which leaves them unable to separate the performance of today's editing models.CPI-Bench 是一套面向接近实际部署条件的图像编辑基准,覆盖多图编辑、对推理要求较高的指令以及实用场景。20 位作者认为,现有基准仍局限于简单的单图任务,因而无法有效区分当下各类图像编辑模型的表现差异。CPI-Bench は実運用に近い条件を想定した画像編集ベンチマークで、複数画像の編集、高度な推論を要する指示、実践的な利用場面を対象とする。20 名の著者は、既存のベンチマークが単純な単一画像タスクにとどまっており、現在の編集モデル同士の性能差を判別できていないと指摘する。
2026-08-15 · SATURDAY · 13:05 PDT
1LiveAnimate: Stable Long-Form Streaming Human Animation in Real-TimeLiveAnimate:实时稳定的长时流式人体动画生成LiveAnimate: 実時間で安定した長尺ストリーミング人物アニメーション12 UPVOTES · YUXUAN ZHANG ET AL. · QWEN BUSINESS UNIT · ARXIV 2608.11745LiveAnimate turns a single reference image and a driving pose stream into human animation in real time, aimed at live streaming, telepresence and virtual avatars where diffusion systems need minutes per clip. It is built on a 14B-parameter video diffusion transformer with two-stage training, which the authors call the first system to pair real-time streaming with stable long-form generation at that scale.LiveAnimate 可将单张参考图像与驱动姿态流实时转换为人体动画,面向直播、远程呈现和虚拟形象等场景——现有扩散方法生成一段片段往往需要数分钟。该系统基于 140 亿参数的视频扩散 Transformer,采用两阶段训练,作者称其是首个在该规模上兼顾实时流式生成与长时稳定输出的系统。LiveAnimate は、1 枚の参照画像と駆動ポーズ列から人物アニメーションをリアルタイムに生成し、ライブ配信やテレプレゼンス、バーチャルアバターを想定する。従来の拡散モデルは 1 クリップの生成に数分を要していた。140 億パラメータの動画拡散 Transformer を二段階学習で構築し、この規模でリアルタイム配信と長尺の安定生成を両立した初のシステムだと著者は述べている。
2Full-bandwidth transformer全带宽 Transformerフルバンド幅 Transformer10 UPVOTES · XI WANG ET AL. · MICROSOFT RESEARCH · ARXIV 2608.08888Microsoft Research proposes widening the vertical feedback channel in autoregressive transformers, where today only the sampled token returns to the bottom of the stack and the top-layer hidden state is discarded. The full-bandwidth transformer fuses that previous hidden state with the sampled token embedding through a gated linear unit at each decoding step.微软研究院提出拓宽自回归 Transformer 中的纵向反馈通道:现有解码过程只把采样得到的 token 送回堆栈底部,而顶层隐状态被直接丢弃。全带宽 Transformer 在每个解码步通过门控线性单元,将上一步的顶层隐状态与采样 token 的嵌入融合。Microsoft Research は、自己回帰 Transformer の垂直方向のフィードバック経路を広げる手法を提案した。現在の復号では、サンプリングされたトークンだけがスタック下部に戻り、最上層の隠れ状態は破棄されている。フルバンド幅 Transformer は各復号ステップで、直前の最上層隠れ状態とトークン埋め込みをゲート付き線形ユニットで融合する。
3An AI4AI Framework for Visual Token Pruning面向视觉 token 剪枝的 AI4AI 框架視覚トークン枝刈りのための AI4AI フレームワーク7 UPVOTES · ZHEN LIU ET AL. · ARXIV 2608.07193Visual token pruning cuts the inference cost of multimodal LLMs, but the methods in use rely on hand-tuned heuristics and expert trial and error. This paper asks whether large language models can design the pruning algorithms themselves, and proposes an AI4AI framework that searches the design space as pruning objectives, budgets and architectures multiply.视觉 token 剪枝可以显著降低多模态大模型的推理成本,但现有方法大多依赖手工设计的启发式规则和专家反复试错。这篇论文提出让大语言模型自行设计剪枝算法,构建了一个 AI4AI 框架,在剪枝目标、预算和模型架构不断增多的设计空间中自动搜索。視覚トークンの枝刈りはマルチモーダル大規模言語モデルの推論コストを大きく下げられるが、既存手法は手作業のヒューリスティクスと専門家の試行錯誤に依存している。本論文は大規模言語モデル自身に枝刈りアルゴリズムを設計させられるかを問い、目的・予算・アーキテクチャが多様化する設計空間を探索する AI4AI フレームワークを提案する。
4H2R-Bench: Benchmarking Human-to-Robot Manipulation Video Generation in World ModelsH2R-Bench:世界模型中人到机器人操作视频生成的基准H2R-Bench: 世界モデルにおける人間からロボットへの操作動画生成ベンチマーク7 UPVOTES · DINGYI RONG ET AL. · SHANGHAI JIAO TONG UNIVERSITY · ARXIV 2608.13049Robot demonstration data is expensive to collect, while egocentric human manipulation video is abundant but hard to transfer across embodiments. H2R-Bench, from Shanghai Jiao Tong University, evaluates how well video world models synthesize robot-centric manipulation clips from human footage, a cross-embodiment capability the authors say remains largely untested.机器人示教数据采集成本高昂,而第一人称的人类操作视频资源丰富,却难以跨形态迁移到机器人。上海交通大学提出的 H2R-Bench 用于评估视频世界模型能否从人类视频合成以机器人为主体的操作片段,作者指出这一跨形态能力此前基本未被系统检验。ロボットの実演データ収集は高コストである一方、一人称視点の人間の操作動画は豊富だが、身体構造の違いから転用が難しい。上海交通大学の H2R-Bench は、動画ワールドモデルが人間の映像からロボット視点の操作クリップをどれだけ合成できるかを評価する。著者はこの身体間転移能力がほとんど検証されてこなかったと指摘する。
5Thought-Level Beam Search for Reasoning面向推理的思维级束搜索推論のための思考レベルビームサーチ6 UPVOTES · LIJIE YANG ET AL. · PRINCETON UNIVERSITY · ARXIV 2608.08020Princeton researchers frame test-time reasoning as a compute allocation problem over partial trajectories rather than a question of how much compute to spend. They argue that parallel sampling treats traces independently and creates memory bottlenecks, while subtractive pruning starves promising branches, and propose beam search over whole thoughts instead of tokens.普林斯顿大学的研究者把测试时推理重新表述为对部分推理轨迹的算力分配问题,而不是「该花多少算力」的问题。他们指出并行采样把各条轨迹当作彼此独立,会造成严重的显存瓶颈,而剪枝式方法又会「饿死」有希望的分支,为此提出以完整思维而非 token 为单位的束搜索。プリンストン大学の研究者らは、テスト時推論を「どれだけ計算資源を使うか」ではなく、途中までの推論軌跡にどう配分するかという問題として定式化した。並列サンプリングは各軌跡を独立に扱うためメモリのボトルネックを生み、枝刈り型の手法は有望な分岐を早期に切り捨てると指摘し、トークンではなく思考単位でのビームサーチを提案する。
2026-08-14 · FRIDAY · 13:05 PDT
1Alaya-EVOKE: From Linear-Scaling Supervision to Endless WorldAlaya-EVOKE:从线性扩展的监督到无尽世界Alaya-EVOKE: 線形スケーリングの教師信号から終わりなき世界へ81 UPVOTES · YUANYANG YIN ET AL. · ARXIV 2608.13546Evoke is an interactive world model that externalizes persistent world state instead of holding history in the denoiser context or key-value cache, whose cost grows with session length. Scene geometry is maintained outside the model and the teacher is redesigned for long-horizon interactive generation. The paper drew 81 upvotes, the most of the day.Evoke 是一种交互式世界模型,它将持久化的世界状态外置,而不是把历史保存在去噪器上下文或键值缓存中,后者的开销会随会话长度增长。场景几何在模型之外维护,同时重新设计教师模型以支持长时程交互式生成。该论文获得 81 个赞,为当日最高。Evoke は、履歴をデノイザーのコンテキストや KV キャッシュに保持する代わりに、永続的な世界状態を外部化する対話型ワールドモデルである。シーンの幾何情報はモデルの外部で保持され、教師モデルは長時程の対話生成向けに再設計された。同論文は当日最多の 81 票を集めた。
2DarwinX: Evolving Agent Harnesses Through Natural SelectionDarwinX:通过自然选择进化智能体框架DarwinX: 自然選択によるエージェント・ハーネスの進化54 UPVOTES · YIFAN ZHANG ET AL. · SALESFORCE AI RESEARCH · ARXIV 2608.07545DarwinX treats agent self-improvement as selection over a population of harnesses - prompts, tools, skills and control flow - with the model weights frozen. A preserve-and-extend contract admits only variants that extend coverage without regressing other tasks, while an archive keeps alternative lineages available for recombination.DarwinX 将智能体的自我改进视为对一组框架(提示词、工具、技能与控制流)种群的选择过程,模型权重保持冻结。其“保留并扩展”约定只接纳能扩大覆盖范围且不导致其他任务退化的变体,同时用存档保留其他谱系以供重组。DarwinX は、モデルの重みを凍結したまま、プロンプト・ツール・スキル・制御フローからなるハーネスの集団に対する選択としてエージェントの自己改善を捉える。「保存と拡張」の契約により、他タスクを劣化させずにカバー範囲を広げる変異のみを採用し、アーカイブが別系統を組み換え用に保持する。
3How Can Rhetoric Reward-Hack AI Reviewers? Dissecting Rhetorical Sensitivity in AI-Based Peer Review修辞如何对 AI 审稿人实施奖励攻击?剖析 AI 同行评审中的修辞敏感性レトリックはAIレビュアーをどう報酬ハックするか: AI査読における修辞的感受性の解剖38 UPVOTES · MING LI ET AL. · UNIVERSITY OF MARYLAND · ARXIV 2608.08975The authors rewrote 120 anonymized ICLR 2026 submissions along six rhetorical dimensions while preserving the reported scientific content, producing a controlled corpus of 4,200 manuscripts. Five LLM reviewers then scored the results under standard and strict protocols, measuring how far presentation alone shifts AI review judgments.作者在保持所报告科学内容不变的前提下,沿六个修辞维度改写了 120 篇匿名的 ICLR 2026 投稿,构建出包含 4200 篇稿件的受控语料。随后由五个大模型审稿人在标准与严格两种协议下评分,以衡量仅凭表达方式就能在多大程度上改变 AI 的评审判断。著者らは、報告された科学的内容を保ったまま、匿名化された ICLR 2026 投稿 120 本を 6 つの修辞的次元に沿って書き換え、4200 本の統制コーパスを構築した。5 つの LLM レビュアーが標準および厳格なプロトコルで採点し、提示の仕方だけで AI の査読判断がどこまで動くかを測定した。
4Spatial Memory Agent: Experience-Grounded Procedure Memory for Spatial Intelligence空间记忆智能体:面向空间智能的经验驱动流程记忆空間記憶エージェント: 空間知能のための経験に基づく手順記憶27 UPVOTES · HAOKAI ZHANG ET AL. · ZHEJIANG UNIVERSITY · ARXIV 2608.12743The paper asks whether a frozen vision-language model can improve its spatial reasoning through accumulated experience alone. It proposes procedure memory grounded in past attempts as a third route, complementary to post-training methods such as fine-tuning and to agents that call external depth and 3D reconstruction tools.该论文探讨冻结参数的视觉语言模型能否仅凭经验积累提升空间推理能力。作者提出以过往尝试为依据的流程记忆,作为第三条路径,与微调等后训练方法以及调用深度估计、三维重建等外部工具的智能体形成互补。本論文は、重みを凍結した視覚言語モデルが経験の蓄積だけで空間推論を改善できるかを問う。過去の試行に基づく手順記憶を第三の道として提案し、ファインチューニングなどの事後学習や、深度推定・3D 復元といった外部ツールを呼ぶエージェント手法を補完する。
5Massive Activations in Hybrid Linear Attention Large Language Models: Pre-Attention Spikes and Inter-Spike Plateaus混合线性注意力大模型中的巨量激活:注意力前尖峰与尖峰间平台ハイブリッド線形アテンションLLMにおける巨大活性化: アテンション前スパイクとスパイク間プラトー16 UPVOTES · ZUNHAI SU ET AL. · STARTLUX · ARXIV 2608.12149This is the first systematic study of massive activations in layer-interleaved hybrid linear attention models, and it identifies two recurring shapes: spikes that appear immediately before full attention layers, and plateaus that persist across the intervening linear attention layers. The organization recurred across five linear attention architectures.这是首个针对层间交错式混合线性注意力模型中巨量激活的系统性研究,识别出两种反复出现的形态:紧接在全注意力层之前出现的尖峰,以及跨越中间线性注意力层持续存在的平台。该组织形式在五种线性注意力架构中反复出现。層が交互に配置されたハイブリッド線形アテンションモデルにおける巨大活性化を初めて体系的に調べた研究で、フルアテンション層の直前に現れるスパイクと、その間の線形アテンション層をまたいで持続するプラトーという二つの形態を特定した。この構造は 5 つの線形アテンション・アーキテクチャで共通して確認された。
2026-08-13 · THURSDAY · 13:05 PDT
1Spark-to-Paper: End-to-End Research Paper Generation as a Composable SkillSpark-to-Paper:以可组合技能实现端到端论文生成Spark-to-Paper: 合成可能なスキルとしての端から端までの論文生成176 UPVOTES · ZHUOYANG QIAN ET AL. · ARXIV 2608.11924Spark-to-Paper turns a research idea into a complete paper through thirteen composable skills running inside an existing coding assistant, with no separate agent platform or orchestration service. The system retrieves literature, designs and runs experiments, revises claims against evidence and produces publication-ready figures, separating model judgment from deterministic operations.Spark-to-Paper 把一个研究想法推进为完整论文,方式是在现有编程助手内部运行十三项可组合的技能,无需另建智能体平台或编排服务。系统会检索文献、设计并执行实验、依据证据修订论断,并生成可直接发表的图表,同时把模型判断与确定性操作分开处理。Spark-to-Paper は、既存のコーディングアシスタント内で動く 13 の合成可能なスキルによって、研究アイデアを完成した論文へと仕上げる。専用のエージェント基盤やオーケストレーションサービスを必要とせず、文献検索、実験の設計と実行、証拠に基づく主張の修正、投稿可能な図の作成までを担い、モデルによる判断と決定的な処理を分離している。
2Mechanist: AI as a Scientific Instrument for Discovering the Mechanisms of IntelligenceMechanist:把 AI 当作科学仪器来发现智能的内在机制Mechanist: 知能のメカニズムを発見する科学的計測器としての AI73 UPVOTES · MENGRU WANG ET AL. · ZJUNLP · ARXIV 2608.12036Mechanist is an agentic system that uses AI itself as a scientific instrument to autonomously discover the mechanisms behind model capabilities. The 19-author team argues that mechanistic exploration remains largely manual even as AI development accelerates and automates, widening the gap between what models can do and what researchers can understand or control.Mechanist 是一套智能体系统,把 AI 本身当作科学仪器,用以自主发现模型能力背后的内在机制。这篇由 19 位作者合著的论文指出,在 AI 研发不断加速并走向自动化的同时,机制层面的探索仍主要依赖人工,使模型能力与研究者的理解、控制之间的差距进一步拉大。Mechanist は、AI 自体を科学的な計測器として用い、モデルの能力を支えるメカニズムを自律的に発見するエージェント型システムである。19 名の著者は、AI 開発が加速し自動化される一方でメカニズムの探究は依然として手作業に頼っており、モデルにできることと研究者が理解・制御できることの差が広がっていると論じる。
3SkillZip: Contract-Preserving Graph Compression for Scalable Agent Skill LibrariesSkillZip:面向可扩展智能体技能库的契约保持式图压缩SkillZip: 拡張可能なエージェントスキルライブラリのための契約保持型グラフ圧縮72 UPVOTES · XINGYU TAN ET AL. · ARXIV 2608.05604SkillZip compresses the reusable skill packages that LLM agents load at inference time, so the smallest sufficient executable context fits a limited budget. The authors trace current failures to a unit mismatch, where skills are retrieved as whole packages but reused below that level, and compress as a graph that preserves procedural contracts and keeps routines executable.SkillZip 针对大模型智能体在推理时加载的可复用技能包进行压缩,让「足够执行的最小上下文」能装进有限预算。作者认为现有系统的症结在于粒度错配:技能以整包检索,复用却发生在包以下的层级;为此他们以图的方式压缩,保留过程性契约并确保例程仍可执行。SkillZip は、LLM エージェントが推論時に読み込む再利用可能なスキルパッケージを圧縮し、実行に十分な最小限のコンテキストを限られた予算に収める。著者らは、スキルがパッケージ単位で検索される一方で再利用はそれより細かい粒度で起きるという単位の不一致を問題とみなし、手続き上の契約を保ったまま実行可能性を維持するグラフ圧縮を提案する。
4Articulated Object Reconstruction from Rest-State Observation仅凭静止状态观测重建可动物体静止状態の観測からの可動物体の再構成42 UPVOTES · DAEUN LEE ET AL. · SEOUL NATIONAL UNIVERSITY · ARXIV 2607.27749The paper reconstructs articulated objects from a single closed configuration, recovering both 3D geometry and the kinematic structure that governs how parts move. Existing methods need observable motion across multiple articulation states, so the Seoul National University team leans on geometry, semantics and motion priors, using an explicit mesh for cross-model verification.该论文只用一个闭合状态的观测就重建出可动物体,同时恢复三维几何与决定各部件如何运动的运动学结构。既有方法需要跨多个关节状态的可观测运动,而首尔大学团队改以几何、语义与运动先验加以弥补,并用显式网格作为中间表示进行跨模型验证。本論文は、閉じた 1 つの状態の観測だけから可動物体を再構成し、3D 形状と各部位の動きを規定する運動学構造の両方を復元する。既存手法は複数の関節状態にわたる観測可能な動きを必要とするため、ソウル大学のチームは幾何・意味・動きの事前知識で補い、明示的なメッシュを中間表現としてモデル間の検証に用いる。
5AdvFD: Boosting Visual Generation via Adversarial Frechet Distance LossAdvFD:用对抗式 Frechet 距离损失提升视觉生成质量AdvFD: 敵対的フレシェ距離損失による視覚生成の強化24 UPVOTES · MINGJU GAO ET AL. · KOLORS TEAM, KUAISHOU TECHNOLOGY · ARXIV 2608.11205AdvFD attacks Frechet hacking, where a generator keeps improving its target Frechet score while visual quality and alignment in other feature spaces stagnate or degrade. The Kuaishou Kolors team blames the static pretrained feature spaces used by existing Frechet losses, which give a fixed and incomplete view of the gap between real and generated distributions.AdvFD 针对所谓「Frechet 刷分」问题:生成器的目标 Frechet 指标持续变好,其他特征空间中的视觉质量与分布对齐却停滞甚至恶化。快手可图团队认为症结在于现有 Frechet 损失所依赖的静态预训练特征空间,它对真实与生成分布之间的差异只提供了固定且不完整的视角。AdvFD は、目標とするフレシェ距離の指標は改善し続ける一方で、他の特徴空間における視覚品質や分布の一致が停滞・悪化する「フレシェ・ハッキング」に取り組む。Kuaishou の Kolors チームは、既存のフレシェ損失が用いる静的な事前学習済み特徴空間が、実データと生成データの差を固定的かつ不完全にしか捉えられない点に原因を求める。