1Agentic Game Development as a Verifiable Trajectory Data Engine for Scaling World Models以智能体游戏开发作为可验证轨迹数据引擎,用于扩展世界模型世界モデルのスケーリングに向けた検証可能な軌跡データエンジンとしてのエージェント型ゲーム開発117 UPVOTES · PENGFEI ZHOU ET AL. · NATIONAL UNIVERSITY OF SINGAPORE · ARXIV 2608.25518The authors argue that scaling world models on more crawled video and more compute is inefficient without grounded reward signals, and propose a recursive data engine built on agentic game development instead. Because games are executable, the trajectories they produce can be scored the way compilers score code agents, rather than through fuzzy proxies such as CLIP scores.作者认为,仅靠抓取更多视频、投入更多算力来扩展世界模型效率低下,缺少的是有据可依的奖励信号,并提出改用建立在智能体游戏开发之上的递归式数据引擎。由于游戏可执行,其产生的轨迹能像编译器为代码智能体打分那样获得高质量奖励,而不必依赖 CLIP 分数这类模糊代理指标。著者らは、より多くの収集動画と計算資源で世界モデルを拡張する戦略は、根拠のある報酬信号を欠く限り非効率だと論じ、代わりにエージェント型のゲーム開発に基づく再帰的なデータエンジンを提案する。ゲームは実行可能であるため、生成される軌跡はコードエージェントに対する コンパイラのように採点でき、CLIP スコアのような曖昧な代理指標に頼らずに済む。
2UrbanGround: From Local Perception to Spatial Agency in a Real-Scale CityUrbanGround:在真实尺度城市中从局部感知走向空间自主行动UrbanGround: 実スケール都市における局所的知覚から空間的行為主体性へ68 UPVOTES · TIANJIE JU ET AL. · SHANGHAI JIAO TONG UNIVERSITY · ARXIV 2608.27456UrbanGround tests whether multimodal LLM agents can turn street-level perception into reliable action once they begin to move through a city. The sandbox is a physically constrained replica of Hong Kong built from territory-wide 3D geospatial data, supporting closed-loop first-person interaction and an interactive map for navigation.UrbanGround 用于检验多模态大模型智能体在城市中开始移动之后,能否把街景层面的局部感知转化为可靠的行动。该沙盒依据覆盖全境的三维地理空间数据,构建了受物理约束的香港复制体,支持第一人称视角的闭环交互,并提供用于导航的交互式地图。UrbanGround は、マルチモーダル LLM エージェントが都市を移動し始めた後も、street view から得た局所的な情報を信頼できる行動に変換できるかを検証する。全域の 3 次元地理空間データから構築した物理制約付きの香港レプリカで、一人称視点の閉ループ操作と、経路探索用の対話的な地図を備える。
3TTPO: Test-Time Policy OptimizationTTPO:测试时策略优化TTPO: テスト時ポリシー最適化62 UPVOTES · AOZHE WANG ET AL. · ARXIV 2608.27448Post-training methods such as reinforcement learning and on-policy self-distillation depend on ground-truth labels, which rules out test-time training, and majority-vote pseudo-labels are fragile because one wrong vote corrupts the teacher. The authors find the failure is asymmetric: rollouts that disagree with the pseudo-label are usually wrong whether or not the vote itself is, and TTPO builds on that.强化学习、同策略自蒸馏等后训练方法依赖真值标签,因而无法用于测试时训练;改用多数投票伪标签又很脆弱,一次投错就会污染教师信号并误导每个 token。作者发现这种失效是不对称的:与伪标签不一致的 rollout 通常本身就是错的,无论投票是否正确,TTPO 正是建立在这一不对称性之上。強化学習やオンポリシー自己蒸留といった事後学習は正解ラベルに依存するため、テスト時学習には使えない。多数決の擬似ラベルで代用する手も、一票の誤りが教師信号を汚染し全トークンを誤導するため脆い。著者らはこの失敗が非対称であること、すなわち擬似ラベルと食い違う rollout は投票の正誤にかかわらず概ね誤りである点に着目し、TTPO を構成した。
4Self-OPD: On-Policy Distillation for Flow Matching Models without TeacherSelf-OPD:无需教师模型的流匹配模型同策略蒸馏Self-OPD: 教師モデルを用いないフローマッチングモデルのオンポリシー蒸留55 UPVOTES · SHIYI ZHANG ET AL. · ARXIV 2608.26872On-policy distillation gives dense supervision but normally requires a specialized teacher trained for every new objective, and the gap between teacher and student distributions compounds errors along the generation trajectory. Self-OPD is a teacher-free framework that keeps the dense signal for flow matching models while removing both costs.同策略蒸馏能提供稠密的监督信号,但通常要为每个新目标单独训练专用教师模型,成本高昂,而且教师与学生分布之间的差异会沿生成轨迹不断累积误差。Self-OPD 提出一种无需教师的框架,在流匹配模型上保留稠密信号的同时消除这两项开销。オンポリシー蒸留は密な教師信号を与えられる一方、新しい目的ごとに専用の教師モデルを訓練する必要があり計算コストが高く、教師と生徒の分布のずれが生成軌跡に沿って誤差を累積させる。Self-OPD は教師を必要としない枠組みで、フローマッチングモデルにおいて密な信号を保ちながらこの二つの問題を取り除く。
5What Makes Good Agentic Data? An ACE Lens on Data Generation for LLM Agents什么才是好的智能体数据?以 ACE 视角审视面向大模型智能体的数据生成優れたエージェント用データとは何か: LLM エージェント向けデータ生成を ACE の視点で捉える55 UPVOTES · XINGSHAN ZENG ET AL. · ARXIV 2608.27260Work on generating interaction data for LLM agents is organized by domain and evaluated inconsistently, which obscures the mechanisms the methods share and blurs candidate construction into verification and selection. This paper proposes a two-level framework for the field, treating consistency among environments, tasks, interactions and success signals as what generation must preserve.面向大模型智能体的交互数据生成研究按领域各自组织、评测口径不一,既掩盖了各方法共通的生成机制,也把候选数据构造与验证、筛选混为一谈。本文为该领域提出一个两层框架,把环境、任务、交互与成功信号之间的一致性视作数据生成必须保持的核心。LLM エージェント向けの相互作用データ生成の研究は領域ごとに整理され評価もばらばらで、手法に共通する生成メカニズムが見えにくく、候補の構築と検証・選別が混同されている。本論文はこの分野に二層の枠組みを提示し、環境・タスク・相互作用・成功信号の間の一貫性こそ生成が保つべきものだと位置づける。
2026-08-27 · THURSDAY · 13:05 PDT
1VGI-BENCH: Probing Visual Intelligence in Video Generation ModelsVGI-BENCH:探测视频生成模型中的视觉智能VGI-BENCH:動画生成モデルの視覚的知能を測る139 UPVOTES · XUAN HE ET AL. · UNIVERSITY OF ILLINOIS AT URBANA-CHAMPAIGN · ARXIV 2608.19583A 22-author team led from the University of Illinois at Urbana-Champaign introduced VGI-bench, a benchmark for the zero-shot visual reasoning that video generation models can show through their generated frames. It holds 27 tasks and 810 instances under a two-level taxonomy of task domains and skill tags. Tasks demand a valid evolving process, not just a plausible final state.一支由伊利诺伊大学厄巴纳-香槟分校牵头的 22 人团队提出 VGI-bench,用于评测视频生成模型通过生成帧所展现的零样本视觉推理能力。基准包含 27 类任务、810 个实例,按任务领域与技能标签构成两级分类体系。任务要求模型给出合理的演化过程,而不只是看似合理的最终画面。イリノイ大学アーバナ・シャンペーン校を中心とする 22 名の著者チームは、動画生成モデルが生成フレームを通じて示すゼロショットの視覚推論を測るベンチマーク VGI-bench を発表した。タスク領域とスキルタグの 2 層分類のもとに 27 タスク、810 インスタンスを収める。最終状態がもっともらしいだけでは足りず、妥当な過程の推移が求められる。
2JIT-Agent: Scaling Harness Intelligence via Just-in-Time Harness EvolutionJIT-Agent:以即时的 harness 演化扩展 harness 智能JIT-Agent:ジャストインタイムのハーネス進化でハーネス知能をスケールさせる47 UPVOTES · GUIBIN ZHANG ET AL. · NATIONAL UNIVERSITY OF SINGAPORE · ARXIV 2608.25593Researchers at the National University of Singapore presented JIT-Agent, a model trained to synthesize an agent harness on the fly for any off-the-shelf agentic LLM. It formalizes the harness - memory, planning, action protocol, tool and skill orchestration - as a composable, machine-generatable artifact. The premise is that harness design, still manual, can dominate the contribution of the underlying model.新加坡国立大学的研究者提出 JIT-Agent,这是一个经过训练、能为任意现成智能体大模型即时合成 harness 的模型。论文把 harness(记忆管理、规划策略、动作协议与工具及技能编排)形式化为可组合、可由机器生成的产物。其前提是:harness 设计目前仍靠手工且与任务绑定,但它对最终效果的影响可以超过底层模型本身。シンガポール国立大学の研究者らは、既製のエージェント LLM 向けにハーネスをその場で合成するよう訓練したモデル JIT-Agent を発表した。記憶管理、計画戦略、行動プロトコル、ツールとスキルの編成から成るハーネスを、組み合わせ可能で機械生成できる成果物として定式化する。ハーネス設計は依然として手作業かつタスク固有だが、その寄与は基盤モデル自体を上回りうるという前提に立つ。
3CyberFactory: Scaling Cyber Security Capabilities with Instances from the WildCyberFactory:用真实世界样本扩展网络安全能力CyberFactory:実世界の事例でサイバーセキュリティ能力をスケールする30 UPVOTES · JIAN YANG ET AL. · IQUEST · ARXIV 2608.23181A team at IQuest released CyberFactory, a unified open-source framework for building cybersecurity capability into large language models. The paper argues open efforts trail closed models here because frontier open-weight releases ship no reproducible security training recipe, while existing open work covers isolated tasks and lacks scalable agentic data.IQuest 团队发布 CyberFactory,一个用于为大语言模型构建网络安全能力的统一开源框架。论文认为开源阵营在这一方向落后于闭源模型:前沿开放权重模型未提供可复现的安全训练方案,而现有开源工作只覆盖孤立任务,缺少可规模化的智能体数据。IQuest のチームは、大規模言語モデルにサイバーセキュリティ能力を持たせるための統一的なオープンソース基盤 CyberFactory を公開した。論文は、フロンティアのオープンウェイト・モデルが再現可能なセキュリティ訓練手順を示さず、既存のオープンな取り組みも個別タスクにとどまり大規模なエージェント・データを欠くため、この領域でクローズドなモデルに後れを取っていると論じる。
4D^3-MOPD: Adaptive Dynamic Domain ScheDuling for Efficient Multi-Teacher DistillationD^3-MOPD:面向高效多教师蒸馏的自适应动态领域调度D^3-MOPD:効率的な多教師蒸留のための適応的な動的ドメイン・スケジューリング22 UPVOTES · ZECHEN SUN ET AL. · ARXIV 2608.24987A ten-author team proposed D^3-MOPD, which adapts the per-domain data mixture during multi-teacher on-policy distillation instead of fixing it before training. Their motivation is that domains converge at very different rates, so a fixed mixture spends compute on domains that plateaued early while undertraining the slower ones.一支十人团队提出 D^3-MOPD:在多教师同策略蒸馏过程中动态调整各领域的数据配比,而不是在训练开始前就将其固定。出发点在于不同领域的收敛速度差异很大,固定配比会把算力浪费在早早收敛的领域,同时让收敛慢的领域训练不足。10 名の著者チームは、多教師オンポリシー蒸留において領域ごとのデータ配合を訓練前に固定せず、学習中に適応させる D^3-MOPD を提案した。領域ごとに収束の速さが大きく異なるため、固定配合では早期に頭打ちになった領域に計算資源を費やし、収束の遅い領域は訓練不足になるという問題に対処する。
5Agent-G^2: Gaussian Guidance for Agentic Reinforcement LearningAgent-G^2:面向智能体强化学习的高斯引导Agent-G^2:エージェント強化学習のためのガウス的ガイダンス20 UPVOTES · ZIXUAN WANG ET AL. · ZHEJIANG UNIVERSITY · ARXIV 2608.23318Zhejiang University researchers proposed Agent-G^2 for hint-based reinforcement learning, in which a prefix of an expert trajectory is retained before each rollout so the policy explores from a state closer to success. Existing methods treat that guidance depth as one deterministic number; the authors find useful guidance instead occupies a band of depths.浙江大学的研究者提出 Agent-G^2,面向基于提示的强化学习:每次 rollout 前保留一段专家轨迹前缀,让策略从更接近成功的状态开始探索。现有方法把这一「引导深度」当作单一确定值,而作者发现真正有用的引导分布在一个深度区间内。浙江大学の研究者らは、ヒント型強化学習に向けた Agent-G^2 を提案した。各ロールアウトの前に熟練軌跡の先頭部分を残し、成功に近い状態から方策を探索させる手法である。既存手法はこのガイダンス深度を単一の決定的な値として扱うが、著者らは有用なガイダンスが一定の深度帯に広がることを見いだした。
2026-08-26 · WEDNESDAY · 13:05 PDT
1GigaBrain-0.7: Scaling Embodied Foundation Models to Emergent Capabilities with a Three-System ArchitectureGigaBrain-0.7:用三系统架构将具身基础模型扩展至涌现能力GigaBrain-0.7: 三システム構成によるエンボディッド基盤モデルのスケーリングと能力の創発89 UPVOTES · GIGABRAIN TEAM ET AL. · GIGAAI · ARXIV 2608.15875GigaAI presents GigaBrain-0.7, an embodied foundation model organized around a three-system architecture. The paper asks whether current vision-language-action systems still gain from better architectural design and from far larger, more heterogeneous training data, and reports improved generalization across different robot embodiments and tasks.GigaAI 发布具身基础模型 GigaBrain-0.7,采用三系统架构组织。论文追问当前的视觉-语言-动作系统能否从更优的架构设计以及规模更大、更异构的训练数据中继续获益,并报告该模型在不同机器人形态与任务上的泛化能力有所提升。GigaAI は、三つのシステムからなる構成を軸としたエンボディッド基盤モデル GigaBrain-0.7 を発表した。論文は、現在の視覚・言語・行動(VLA)システムがより良いアーキテクチャ設計と、はるかに大規模で多様な学習データからなお恩恵を受けられるのかを問い、異なるロボットの身体や課題をまたぐ汎化の改善を報告している。
2AutoSaddler: Automatic Harness Optimization with Durable Updates from Agent Execution TracesAutoSaddler:从智能体执行轨迹中持久更新,自动优化运行框架AutoSaddler: エージェント実行トレースからの永続的な更新によるハーネス自動最適化49 UPVOTES · SUNGHO PARK ET AL. · MICROSOFT · ARXIV 2608.23041Microsoft proposes AutoSaddler, which recasts agent harness design as an offline learning problem rather than manual search over prompts, tool configurations and control logic. It reads failure signals from execution traces in mini-batches and iteratively updates the harness. The target is long-horizon tasks, where small local failures compound into overall failure.微软提出 AutoSaddler,把智能体运行框架(harness)的设计从对提示词、工具配置与控制逻辑的人工搜索,改写为一个离线学习问题。该方法以小批量方式从执行轨迹中读取失败信号,迭代更新 harness。目标场景是长程任务,其中局部的小失误会累积成整体失败。マイクロソフトは AutoSaddler を提案した。プロンプト、ツール構成、制御ロジックを人手で探索していたエージェント・ハーネスの設計を、オフライン学習の問題として定式化する。実行トレースから得た失敗信号をミニバッチ単位で読み取り、ハーネスを反復的に更新する。狙いは、局所的な小さな失敗が積み重なって全体の失敗になる長期タスクである。
3On-Policy Self-Distillation in Diffusion Models扩散模型中的同策略自蒸馏拡散モデルにおけるオンポリシー自己蒸留47 UPVOTES · WEI ZHOU ET AL. · BYTEDANCE SEED · ARXIV 2608.24646ByteDance Seed introduces DiffusionOPSD, which converts image-level reward guidance into explicit targets for a diffusion model's clean-output predictions. A frozen behavior policy supplies the trajectories and anchors, and reward gradients build bounded positive and negative targets around each anchor. The point is to specify how an intermediate denoising prediction should change, which endpoint rewards do not.字节跳动 Seed 团队提出 DiffusionOPSD,将图像级的奖励引导转化为扩散模型在采样查询状态下对干净输出预测的显式目标。冻结的行为策略提供轨迹与锚点,奖励梯度则在每个锚点周围构造有界的正负目标。其要点在于给出中间去噪预测该如何调整,而终点奖励无法提供这一信息。ByteDance Seed は DiffusionOPSD を提案した。画像レベルの報酬による誘導を、サンプリングしたクエリ状態における拡散モデルのクリーン出力予測に対する明示的な目標へと変換する。凍結した行動方策が軌跡とアンカーを供給し、報酬勾配が各アンカーの周囲に有界の正負の目標を作る。狙いは、終点の報酬では示せない「途中のノイズ除去予測をどう変えるべきか」を与えることにある。
4SecOPD: Mitigating Adaptive Prompt Injections by On-Policy DistillationSecOPD:以同策略蒸馏缓解自适应提示注入SecOPD: オンポリシー蒸留による適応的プロンプトインジェクションの緩和36 UPVOTES · YIBO PENG ET AL. · ARXIV 2608.21500The authors argue that defensive finetuning still fails against adaptive prompt injection because DPO and GRPO grade an entire output with one sequence-level signal, treating every token alike. SecOPD uses on-policy distillation to supply token-level feedback instead. Prompt injection, in which text hidden in fetched pages, files or email redirects an agent, is listed as the top threat to AI agents.作者认为,防御性微调之所以仍难以抵御自适应提示注入,是因为 DPO 与 GRPO 用单一的序列级信号评判整段输出,对每个 token 一视同仁。SecOPD 改用同策略蒸馏来提供 token 级反馈。提示注入指攻击者把指令藏进智能体抓取的网页、文件或邮件中以劫持其行为,被列为 AI 智能体面临的头号威胁。著者らは、防御的なファインチューニングが適応的プロンプトインジェクションに依然として破られるのは、DPO や GRPO が出力全体を一つのシーケンス単位の信号で評価し、すべてのトークンを同等に扱うためだと論じる。SecOPD は代わりにオンポリシー蒸留でトークン単位のフィードバックを与える。取得したページやファイル、メールに仕込まれた指示でエージェントを乗っ取るプロンプトインジェクションは、AI エージェントに対する最大の脅威に挙げられている。
5The Mask Is Not the Model: Auditing Prefix Invariance in Attention, State-Space, and Hybrid Sequence Models掩码不等于模型:审计注意力、状态空间与混合序列模型中的前缀不变性マスクはモデルではない: アテンション・状態空間・ハイブリッド系列モデルにおける前置不変性の監査29 UPVOTES · TAEBONG KIM ET AL. · VIDRAFT · ARXIV 2608.22876The paper formalizes prefix invariance - a representation at position t must not depend on later inputs - and gives a two-forward-pass audit, with no training or gradients, that localizes where causality breaks. Mask inspection is not enough: leaks can travel through scans or normalization. Across 192 injected-fault trials it caught none, while the audit found all 192 plus a defect in Zamba2 and Nemotron-H.论文形式化了前缀不变性,即位置 t 上的表示不得依赖其后的输入,并给出一种只需两次前向传播、无需训练或梯度的审计方法,可定位因果性在何处被打破。仅检查注意力掩码并不够,泄漏可能经由扫描或归一化发生。在 192 组注入故障的试验中,掩码检查一个都没发现,而该审计方法全部定位,并另外查出 Zamba2 与 Nemotron-H 中的缺陷。本論文は前置不変性(位置 t の表現が後続の入力に依存してはならないこと)を定式化し、学習も勾配も不要で順伝播 2 回だけで因果性の破れ箇所を特定する監査手法を示した。アテンション・マスクの点検だけでは不十分で、スキャンや正規化を経由して漏れが生じうる。故障を注入した 192 試行で、マスク点検は 1 件も検出できなかったのに対し、この監査は全件を特定し、さらに Zamba2 と Nemotron-H の欠陥も見つけた。
2026-08-25 · TUESDAY · 13:05 PDT
1TLive-Omni: An Omni-Modal Understanding Model for E-Commerce Live StreamingTLive-Omni:面向电商直播的全模态理解模型TLive-Omni: EC ライブ配信向けのオムニモーダル理解モデル52 UPVOTES · YIBO HU ET AL. · TAOLIVE AIGC · ARXIV 2608.20958TLive-Omni is an omni-modal model built for e-commerce live streams, where product facts are scattered across speech, video frames, product images, overlaid text and viewer questions. It maps image, video, audio and text into a single representation space, and adds Per-vGrid, a timestamped token layout that pairs each video grid with its matching audio inside explicit boundary tokens.TLive-Omni 是一款面向电商直播的全模态理解模型,直播中的商品信息分散在语音、视频画面、商品图、叠加文字和观众提问之中。该模型将图像、视频、音频与文本映射到统一表示空间,并提出带时间戳的 token 组织方式 Per-vGrid,在显式边界标记内把每个视频网格与对应音频配对。TLive-Omni は EC ライブ配信向けのオムニモーダル理解モデルで、商品情報が音声、映像フレーム、商品画像、重畳テキスト、視聴者の質問に分散する状況を対象とする。画像・映像・音声・テキストを単一の表現空間に写像し、各映像グリッドと対応する音声を明示的な境界トークン内で対応付けるタイムスタンプ付きトークン構成 Per-vGrid を導入した。
2InfinityEdit: Infinite Video Editing with a Lightweight Edit-Ignition AdapterInfinityEdit:用轻量 Edit-Ignition 适配器实现无限视频编辑InfinityEdit: 軽量な Edit-Ignition アダプタによる無限動画編集35 UPVOTES · YUNZE TONG ET AL. · ARXIV 2608.20910Instruction-based video editing usually assumes an in-place edit, aligning the output frame by frame with a fixed source clip. InfinityEdit takes on what the authors call infinite video editing, where an instruction given on a preceding segment must carry into frames that arrive later, as when restyling a live game or extending a camera move on an ongoing shot.基于指令的视频编辑通常假设原位编辑,即输出与固定的源片段逐帧对齐。InfinityEdit 研究的是作者所称的无限视频编辑:针对前一段画面给出的指令,必须延续到随后陆续到来的帧上,例如为直播游戏改变画风,或为正在进行的镜头延展运镜。指示ベースの動画編集は通常、出力を固定のソース映像とフレーム単位で対応させるインプレース編集を前提とする。InfinityEdit は著者らが無限動画編集と呼ぶ設定を扱い、先行区間に与えた指示を、後から到着するフレームにも引き継ぐ。ライブゲームの画風変更や、進行中のショットへのカメラワーク付与などが対象となる。
3MobilePA-Bench: Benchmarking Mobile Planner Agents on Complex Real-World TasksMobilePA-Bench:在复杂真实任务上评测移动端规划智能体MobilePA-Bench: 複雑な実世界タスクにおけるモバイル・プランナーエージェントの評価33 UPVOTES · YI ZHU ET AL. · TONGYI-MAI · ARXIV 2608.23035MobilePA-Bench is an interactive, stateful, tool-centric benchmark for on-device LLM agents acting as phone copilots. The authors argue existing tests fall into two camps with matching blind spots: GUI benchmarks that measure only surface screen manipulation, and static function-calling sets that match APIs offline, away from real runtime constraints.MobilePA-Bench 是一个面向端侧 LLM 智能体的交互式、有状态、以工具为中心的评测基准,考察其作为手机助手的能力。作者认为现有评测分为两类且各有盲区:GUI 基准只衡量表层的屏幕操作,而静态函数调用测试则以离线 API 匹配为准,脱离真实运行时约束。MobilePA-Bench は、スマートフォン上のコパイロットとして動作するオンデバイス LLM エージェント向けの、対話的で状態を持つツール中心のベンチマークである。著者らは既存の評価が二分され、GUI ベンチマークは表層的な画面操作しか測らず、静的な関数呼び出しの評価はオフラインの API 一致に依存して実行時の制約から乖離していると指摘する。
4Prime Agent: A Self-Improving RLM HarnessPrime Agent:可自我改进的 RLM 智能体框架Prime Agent: 自己改善する RLM ハーネス32 UPVOTES · SETH KARTEN ET AL. · PRIME INTELLECT · ARXIV 2608.23552Prime Intellect describes Prime Agent, an open-source harness for long-horizon evaluation and coding-agent workflows. A persistent IPython REPL implements the Recursive Language Model abstraction for programmatic context processing and test-time compute, while a Continual Harness carries histories, memories, skills, prompts and subagent specifications across trajectories.Prime Intellect 介绍了开源框架 Prime Agent,面向长程任务评测与编码智能体工作流。其常驻的 IPython REPL 实现了递归语言模型(RLM)抽象,用于程序化的上下文处理与测试时计算;Continual Harness 则在多条轨迹之间保留历史、记忆、技能、提示词与子智能体配置。Prime Intellect は、長期タスクの評価とコーディングエージェントのワークフローに向けたオープンソースのハーネス Prime Agent を発表した。常駐する IPython REPL が再帰言語モデル(RLM)の抽象を実装し、プログラム的な文脈処理とテスト時計算を担う。Continual Harness は履歴、記憶、スキル、プロンプト、サブエージェント定義を軌跡をまたいで保持する。
5Block3D: Efficient Text-to-3D Generation via Block-Wise DiffusionBlock3D:基于分块扩散的高效文本到 3D 生成Block3D: ブロック単位の拡散による効率的なテキストから 3D 生成25 UPVOTES · BOWEN CUI ET AL. · ZHEJIANG UNIVERSITY · ARXIV 2608.19567Block3D generates 3D shapes from text using a block-wise diffusion framework that partitions the discrete shape representation instead of decoding tokens one at a time or refining the whole representation at every step. The authors note that autoregressive decoding cannot revise its own errors, while diffusion and flow models pay full-representation cost each iteration.Block3D 采用分块扩散框架从文本生成 3D 形状,对离散形状表示进行分块处理,而非逐个自回归解码 token 或在每一步刷新整体表示。作者指出,自回归解码无法修正自身错误,而扩散与流匹配模型每次迭代都要付出处理完整表示的代价。Block3D は、離散的な形状表現をブロックに分割する拡散フレームワークでテキストから 3D 形状を生成する。トークンを逐次デコードしたり、毎ステップで表現全体を更新したりする方式とは異なる。著者らは、自己回帰デコードは自らの誤りを修正できず、拡散やフローの手法は反復ごとに表現全体を処理するコストを払うと指摘する。
2026-08-24 · MONDAY · 13:04 PDT
1ParaTempo: Efficient Parallel Reasoning via Temporal ConfidenceParaTempo:基于时间置信度的高效并行推理ParaTempo: 時間的確信度による効率的な並列推論26 UPVOTES · XUTENG ZHANG ET AL. · SHANGHAI JIAO TONG UNIVERSITY · ARXIV 2608.16425ParaTempo is a training-free framework for asynchronous parallel reasoning in large reasoning models. The authors argue that existing controls for parallel branches - final-answer consensus, local token confidence, or isolated intermediate probes - are delayed, weakly tied to reasoning progress, or too noisy for branch-level decisions, and propose a temporal confidence signal instead.ParaTempo 是面向大型推理模型的免训练异步并行推理框架。作者指出,现有的并行分支控制手段(最终答案共识、局部 token 置信度或孤立的中间探针)存在信号滞后、与推理进展关联薄弱、或噪声过大难以支撑分支级决策等问题,转而提出以时间置信度作为控制信号。ParaTempo は、大規模推論モデル向けの学習不要な非同期並列推論フレームワークである。著者らは、最終回答の多数決、局所的なトークン確信度、孤立した中間プローブといった既存の分岐制御手法は、信号が遅れる、推論の進捗との結びつきが弱い、あるいはノイズが多く分岐単位の制御には使えないと指摘し、代わりに時間的確信度を用いる手法を示した。
2Beyond Correctness: Benchmarking and Aligning Response Behaviors in Hybrid-Thinking MLLMs超越正确性:混合思考多模态大模型的响应行为评测与对齐正解率を超えて: ハイブリッド思考型 MLLM における応答挙動のベンチマークとアライメント16 UPVOTES · XINMING WANG ET AL. · TENCENT · ARXIV 2608.12781Tencent researchers examine multimodal models that switch between deliberative thinking and low-latency non-thinking inference, arguing that both modes should meet the same user-facing standard. The work evaluates response-pattern failures alongside task accuracy and tests whether the two interfaces preserve acceptable final-response behavior.腾讯的研究者考察了可在深思模式与低延迟非思考模式之间切换的多模态模型,认为两种模式面向用户时应达到同一标准。研究在任务准确率之外,同时评估响应模式层面的失败,并检验两种接口是否都能保持可接受的最终响应行为。テンセントの研究チームは、熟考モードと低遅延の非思考モードを切り替えるマルチモーダルモデルを対象に、どちらのモードもユーザーに対して同じ水準を満たすべきだと論じる。タスク正解率に加えて応答パターンの失敗を評価し、二つのインターフェースが許容できる最終応答の挙動を保てているかを検証した。
3EviRank: Structured Relevance Evidence for Multimodal Image Re-rankingEviRank:面向多模态图像重排序的结构化相关性证据EviRank: マルチモーダル画像リランキングのための構造化された関連性エビデンス10 UPVOTES · ENJUN DU ET AL. · ARXIV 2608.20886EviRank recasts multimodal image re-ranking as a semantic constraint satisfaction problem, parsing text-only, image-only or composed queries into structured relevance evidence. The authors argue existing re-rankers either compress multifaceted relevance into an opaque embedding or lean on free-form chain-of-thought that drops or hallucinates fine-grained constraints.EviRank 将多模态图像重排序重新表述为语义约束满足问题,把纯文本、纯图像或组合式查询解析为结构化的相关性证据。作者认为,现有重排序方法要么把多维度的相关性压缩进不透明的向量表示,要么依赖自由形式的思维链,容易遗漏或臆造细粒度约束。EviRank は、マルチモーダル画像のリランキングを意味的な制約充足問題として捉え直し、テキストのみ、画像のみ、あるいは複合的なクエリを構造化された関連性エビデンスへと解析する。著者らは、既存のリランカーが多面的な関連性を不透明な埋め込みに圧縮するか、細かな制約を取りこぼしたり捏造したりしやすい自由記述の思考連鎖に依存していると指摘する。
4UniSpace: Unified Visual Representation and Scalable Multimodal ModelingUniSpace:统一视觉表征与可扩展多模态建模UniSpace: 統一的な視覚表現とスケーラブルなマルチモーダルモデリング8 UPVOTES · JINBO YAN ET AL. · LONGCAT · ARXIV 2608.08676UniSpace asks whether understanding, generation and editing can share one visual representation space built from a pretrained semantic vision transformer. The authors note that final tokens from semantic encoders discard fine detail and hurt pixel reconstruction, and show that frozen ViT blocks are not inherently unable to preserve it.UniSpace 探讨能否让理解、生成与编辑共享一个由预训练语义视觉 Transformer 构建的视觉表征空间。作者指出,语义编码器的最终层 token 丢弃了细粒度细节、损害像素级重建,并表明冻结的 ViT 模块本身并非无法保留这些细节。UniSpace は、理解・生成・編集を、事前学習済みの意味的 Vision Transformer から構築した単一の視覚表現空間で扱えるかを問う。著者らは、意味エンコーダーの最終トークンが細部を捨ててしまい画素単位の再構成を損なうと指摘したうえで、凍結した ViT ブロックが本質的に細部を保持できないわけではないことを示した。
5Partition the Support, Reconstruct the Residual: Training-Free Sparse Attention for Video Generation and World Models划分支撑集,重建残差:面向视频生成与世界模型的免训练稀疏注意力サポートを分割し残差を再構成する: 動画生成と世界モデルのための学習不要なスパースアテンション6 UPVOTES · PARDIS TAGHAVI ET AL. · TEXAS A&M UNIVERSITY · ARXIV 2608.18484The paper introduces SparsePR, a training-free block-sparse attention method for video transformers that pairs response-coupled partitioning with probe-fitted residual reconstruction. The authors argue that row-wise attention concentration alone does not specify a usable sparse operator, because queries sharing a block route may have poorly overlapping supports.论文提出 SparsePR,一种面向视频 Transformer 的免训练块稀疏注意力方法,将响应耦合的分区与探针拟合的残差重建结合起来。作者指出,仅有按行的注意力集中度并不足以确定可用的稀疏算子,因为共享同一分块路由的查询,其支撑集可能重叠很少。本論文は、動画向け Transformer のための学習不要なブロックスパースアテンション手法 SparsePR を提案する。応答結合型の分割と、プローブで当てはめた残差再構成を組み合わせる点が特徴だ。著者らは、行単位のアテンション集中度だけでは実行可能なスパース演算子は定まらないと述べる。同じブロック経路を共有するクエリでも、サポートがほとんど重ならない場合があるためだ。
2026-08-22 · SATURDAY · 13:04 PDT
1Thinking in a Low-Resource Language: What SFT Builds, What RL Fixes, What Accuracy Cannot See用低资源语言思考:SFT 建立了什么,RL 修正了什么,准确率看不见什么低資源言語で考える: SFT が築くもの、RL が直すもの、精度が見られないもの13 UPVOTES · AYOUB KIROUANE ET AL. · KIEFER · ARXIV 2608.17744Three frontier mixture-of-experts models with 3.6 to 4.0B active parameters were fine-tuned to reason in Greek, and accuracy barely moved. Changing only the random seed shifted scores by 7.7 points, more than any data or recipe effect measured, making the benchmark itself noise at that scale. What did change was the language of thought: base models produced Greek reasoning in 0 of 1,000 traces.研究者对三个激活参数为 36 亿至 40 亿的前沿混合专家模型进行微调,使其用希腊语推理,结果准确率几乎没有变化。仅更换随机种子就能使分数波动 7.7 分,超过所测的任何数据或配方带来的影响,说明该规模下基准本身就是噪声。真正改变的是思考所用的语言:基座模型在 1,000 条推理轨迹中用希腊语思考的次数为 0。アクティブパラメータ 36 億〜40 億の最先端 MoE モデル 3 つをギリシャ語で推論するようファインチューニングしたが、精度はほとんど動かなかった。乱数シードを変えるだけでスコアは 7.7 ポイント動き、測定したどのデータ・レシピの効果より大きい。変化したのは思考の言語で、ベースモデルは 1,000 件の推論軌跡のうち 0 件しかギリシャ語で考えていなかった。
2Hierarchical Self-Improvement: A Framework for Task-Specific Evolvable Agent Harnesses层级式自我改进:面向任务的可演化代理运行框架階層的自己改善: タスク特化で進化するエージェントハーネスの枠組み10 UPVOTES · TAILIN ZHOU ET AL. · HKUST · ARXIV 2608.08466LLM agents are usually improved by editing prompts, tools or workflows, while the harness that executes around the model stays fixed after deployment. This work makes the harness task-specific and continuously evolvable: each task family keeps its own harness, hot-swapped across iterations through a fixed task-injection seam and rewritten from environment feedback, with a single frozen model throughout.大模型代理通常靠修改提示词、工具或工作流来改进,而围绕模型执行的运行框架(harness)在部署后往往固定不变。该工作让运行框架按任务定制并持续演化:每类任务维护自己的框架,通过固定的任务注入接口在迭代中热替换,并依据环境反馈重写,整个过程只用一个冻结的模型。LLM エージェントの改善は通常プロンプトやツール、ワークフローの手直しで行われ、モデルの周囲で実行を担うハーネスは配備後に固定されたままになる。本研究はハーネスをタスク特化かつ継続的に進化するものとし、タスク系統ごとに専用ハーネスを保持して、固定の注入インターフェース経由で反復ごとにホットスワップし、環境フィードバックから書き換える。モデルは 1 つを凍結したまま用いる。
3EXIMO: VLM Guided Exploration of VLA PoliciesEXIMO:由视觉语言模型引导的 VLA 策略探索EXIMO: VLM が導く VLA ポリシーの探索10 UPVOTES · BHAVYA SUKHIJA ET AL. · DEEPMIND · ARXIV 2608.19891DeepMind takes on how to finetune robot policies for new tasks on the fly. State-of-the-art manipulation rests on behavior cloning of billion-parameter vision-language-action models trained on huge teleoperation datasets, and adapting them is still open: more teleoperation costs hundreds of hours of human labor, while reinforcement learning is sample-hungry. EXIMO has a vision-language model guide exploration.DeepMind 研究如何让机器人策略即时适配新任务。当前最先进的操作能力依赖对十亿参数级视觉-语言-动作模型做行为克隆,训练数据来自海量遥操作记录,而微调仍是未解问题:继续采集遥操作数据需要数百小时人力,强化学习又极其耗样本。EXIMO 改由视觉语言模型引导探索。DeepMind は、ロボットのポリシーを新しいタスクへその場で適応させる問題に取り組む。最先端の操作性能は、膨大な遠隔操作データで学習した数十億パラメータの視覚-言語-行動モデルの模倣学習に依存し、その微調整は未解決だ。遠隔操作データの追加収集は数百時間の人手を要し、強化学習はサンプル効率が悪い。EXIMO は代わりに視覚言語モデルに探索を導かせる。
4Inject, Align, Recover: Staged Post-Training for Retrieval-Free Document Knowledge Internalization注入、对齐、恢复:面向免检索文档知识内化的分阶段后训练Inject, Align, Recover: 検索不要の文書知識内在化に向けた段階的ポストトレーニング10 UPVOTES · QIAN KOU ET AL. · BEIJING ACADEMY OF ARTIFICIAL INTELLIGENCE · ARXIV 2608.20281Language models often fail on questions about a bounded document collection when the sources are not retrieved at inference time. IAR is a three-stage post-training framework that separates the problem: Inject turns source documents into continuation data, Align tunes question-answering behavior, and Recover restores general ability. The authors present it as an alternative to conventional continued pretraining.当推理时不检索原文,语言模型常常答不出关于某个有限文档集合的问题。IAR 是一个三阶段后训练框架,把问题拆开处理:Inject 将源文档转换为续写数据,Align 调整问答行为,Recover 恢复通用能力。作者将其定位为常规继续预训练的替代方案。推論時に原文を検索しない場合、言語モデルは限定された文書集合に関する質問にしばしば答えられない。IAR は問題を三つの段階に分ける後訓練の枠組みで、Inject が原文を継続予測用データに変換し、Align が質問応答の振る舞いを整え、Recover が汎用能力を回復させる。著者らは従来の継続事前学習に代わる手法として提示している。
5NARU: A Benchmark for NARrative Evolution and Cultural Nuance Understanding in Japanese Extreme Long VideoNARU:日语超长视频中叙事演变与文化细微差别理解的基准NARU: 日本語の超長尺動画における物語の展開と文化的機微の理解を測るベンチマーク8 UPVOTES · YUHENG HUANG ET AL. · THE UNIVERSITY OF TOKYO · ARXIV 2608.13210NARU is a benchmark for tracking an evolving narrative and reading implicit social meaning in Japanese long-form video. It holds 1,481 questions grounded in 155 videos totaling 146.8 hours, spanning four narrative and five cultural dimensions. Existing benchmarks rarely test those two capabilities together, especially in high-context non-English media.NARU 是一个基准,用于考察在日语长视频中追踪叙事发展、并读出未言明的社会含义的能力。它包含 1,481 道题,取材自 155 段、合计 146.8 小时的视频,覆盖四个叙事维度和五个文化维度。现有基准很少同时评估这两类能力,在高语境的非英语媒体中尤其如此。NARU は、日本語の長尺動画において物語の展開を追い、明示されない社会的な意味を読み取る能力を測るベンチマーク。155 本・計 146.8 時間の動画に基づく 1,481 問からなり、物語の 4 次元と文化の 5 次元をカバーする。既存のベンチマークでこの二つを同時に評価するものは少なく、高文脈かつ非英語のメディアでは特に乏しい。
2026-08-21 · FRIDAY · 13:08 PDT
1FACET: Preserving Source Intent and Executable State in Terminal Task SynthesisFACET:在终端任务合成中保留源意图与可执行状态FACET: ターミナルタスク合成における元の意図と実行可能な状態の保持102 UPVOTES · KOU SHI ET AL. · UNIVERSITY OF SCIENCE AND TECHNOLOGY OF CHINA · ARXIV 2608.18580Training terminal agents needs executable tasks at scale, yet each task couples an instruction, an initialized environment, a reference solution and a verifier, and inconsistent assumptions across those parts leave tasks unsolvable or wrongly graded. FACET synthesizes tasks while carrying the goals, dependencies and state transitions of the original sources through the pipeline.训练终端智能体需要大规模可执行任务,但每个任务同时包含指令、初始化环境、参考解法与验证器,一旦各部分的假设互不一致,任务就会无解或被错误评判。FACET 在合成过程中保留原始素材中的目标、依赖关系与状态转移,以细粒度的智能体化方式构建任务。ターミナル操作を担うエージェントの学習には実行可能なタスクが大量に要るが、各タスクは指示、初期化された環境、参照解、検証器を同時に抱えており、前提が食い違えばタスクは解けないか誤って採点される。FACET は元の素材にある目標、依存関係、状態遷移を合成の各段階に持ち越してタスクを構築する。
2SWE-bench Science: Can Coding Agents Resolve Engineering Tasks in Science?SWE-bench Science:编码智能体能否解决科学领域的工程任务?SWE-bench Science: コーディングエージェントは科学の工学的課題を解けるか51 UPVOTES · ZHIPENG XU ET AL. · OPENMOSS · ARXIV 2608.19799OpenMOSS introduced SWE-bench Science, a repository-level benchmark of 119 tasks drawn from 98 GitHub repositories across 20 scientific domains. It is built to show why coding agents fail when repairing scientific software rather than only whether they succeed, on the argument that faulty scientific code can compromise the evidence behind published conclusions.OpenMOSS 推出 SWE-bench Science,这是一个仓库级基准,包含取自 20 个科学领域、98 个 GitHub 仓库的 119 项任务。它的设计不只看编码智能体能否修复科学软件,更要揭示它们失败的原因,理由是有缺陷的科学代码可能动摇论文结论所依赖的证据。OpenMOSS は SWE-bench Science を公開した。20 の科学分野、98 の GitHub リポジトリから集めた 119 課題からなるリポジトリ規模のベンチマークである。成否の集計にとどまらず、コーディングエージェントが科学ソフトの修復でなぜ失敗するのかを示す設計で、欠陥のあるコードは論文の結論を支える証拠自体を損ないうるという問題意識に立つ。
3WithEveryone: Unified Planning and Identity Grounding for Group Image GenerationWithEveryone:面向合影生成的统一规划与身份对齐WithEveryone: 集合写真生成のための統一的な計画立案と同一性の接地34 UPVOTES · HENGYUAN XU ET AL. · TENCENT HUNYUAN · ARXIV 2608.20336Tencent Hunyuan's WithEveryone generates group images holding up to ten specified people without their identities blurring together. Each reference is injected as an addressed token, the model predicts a structured identity and layout plan, and that plan is rendered back as a visual condition for generation.腾讯混元提出 WithEveryone,可生成最多包含十个指定人物的合影,而不至于让各人身份彼此混淆。每个参考人物以带地址的 token 注入,模型先预测结构化的身份与布局方案,再把该方案渲染为视觉条件用于生成。テンセント混元の WithEveryone は、指定した最大 10 人を含む集合写真を、各人の同一性が混ざらないように生成する。参照人物ごとに宛先付きのトークンを注入し、構造化された同一性とレイアウトの計画を予測したうえで、その計画を視覚的な条件として描き戻す仕組みである。
4MemTrapBench: Benchmarking Cognitive Traps in LLM Memory UseMemTrapBench:大模型记忆使用中的认知陷阱基准MemTrapBench: LLM の記憶利用に潜む認知の罠を測るベンチマーク24 UPVOTES · MENGRU WANG ET AL. · ZJUNLP · ARXIV 2608.20202MemTrapBench targets what its authors call memory-induced cognitive traps: even a faithfully recorded and relevant memory can distort a model's reasoning and hurt performance on the task at hand. Existing memory benchmarks mostly check whether information was extracted, stored and retrieved correctly, not how the retrieved text reshapes the answer.MemTrapBench 针对作者所称的记忆诱发认知陷阱:即便是被如实记录且语义相关的记忆,也可能扭曲模型推理,拖累当前任务的表现。现有记忆基准大多只检验信息是否被正确抽取、存储与检索,而忽略了取回的内容如何改变最终作答。MemTrapBench は著者が記憶由来の認知の罠と呼ぶ現象を対象とする。忠実に記録され意味的にも関連する記憶であっても、モデルの推論をゆがめ、目の前の課題の成績を落としうるという問題である。既存の記憶ベンチマークは情報が正しく抽出・保存・検索されたかを見るにとどまり、取り出した記憶が答えをどう作り替えるかは扱ってこなかった。
5SkillEvo: Self-Renewing Evolution Gradients from Multi-Turn Interaction FeedbackSkillEvo:从多轮交互反馈中自我更新的进化梯度SkillEvo: マルチターンの対話フィードバックから自己更新する進化勾配21 UPVOTES · QIANXI YAN ET AL. · TENCENT · ARXIV 2608.13120Agent skills are usually hand-authored or produced in a single generation pass, so they never learn from the failures they cause. Tencent's SkillEvo argues that recent feedback loops stall because they score skills on single-turn question answering, which hides defects that only surface across several turns, and instead draws its evolution signal from multi-turn interaction.智能体技能通常靠人工撰写,或由模型一次性生成,因而无法从自己引发的失败中学习。腾讯提出的 SkillEvo 认为,已有的反馈闭环之所以很快停滞,是因为它们以单轮问答来评估技能,掩盖了只有在多轮交互中才暴露的缺陷,因此改从多轮交互反馈中提取进化信号。エージェントのスキルは人手で書かれるか、モデルが一度の生成で作るのが常で、自らが招いた失敗から学ぶ経路を持たない。テンセントの SkillEvo は、既存のフィードバック閉ループが早々に頭打ちになるのは単一ターンの質疑応答でスキルを評価するためであり、それでは複数ターンでしか現れない欠陥が見えないとして、多ターンの対話から進化の信号を取り出す。