1SWE-Bench ProMax: Benchmarking Agents on Large-Scale Multilingual Code RefactoringSWE-Bench ProMax:在大规模多语言代码重构上评测智能体SWE-Bench ProMax: 大規模多言語コードリファクタリングでエージェントを評価する70 UPVOTES · YULING SHI ET AL. · BYTEDANCE · ARXIV 2608.09802A ByteDance team proposes SWE-Bench ProMax, a coding-agent benchmark built on large-scale multilingual refactoring instead of bug fixes. The authors cite an audit finding that nearly 60 percent of unsolved SWE-bench Verified instances have flawed tests, and that frontier models can reproduce gold patches verbatim. Refactoring demands behaviour-preserving edits coordinated across many files.字节跳动团队提出 SWE-Bench ProMax,这一编码智能体基准以大规模多语言重构任务取代缺陷修复。作者引用一项审计结果:SWE-bench Verified 中未解决实例近 60% 存在测试缺陷,且前沿模型能逐字复现标准补丁。重构要求在众多文件间协同完成保持行为不变的修改。ByteDance のチームが、バグ修正ではなく大規模な多言語リファクタリングを土台としたコーディングエージェント向けベンチマーク SWE-Bench ProMax を提案した。著者らは、SWE-bench Verified の未解決事例の約 6 割でテストに欠陥があり、フロンティアモデルが正解パッチをそのまま再現できるとする監査結果を挙げる。リファクタリングは多数のファイルにまたがる挙動保存の編集を要求する。
2SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMsSFT 冲突,RL 共存:大模型多任务学习的理论与实证分析SFT は衝突し、RL は共存する: LLM のマルチタスク学習に関する理論的・実証的分析40 UPVOTES · KEJIAN ZHU ET AL. · CHINESE ACADEMIC OF SCIENCE INSTITUTE OF AUTOMATION · ARXIV 2608.03573Researchers at the Chinese Academy of Sciences Institute of Automation report that supervised fine-tuning suffers severe task conflicts under multi-stage training while reinforcement learning lets diverse tasks coexist. Traced to the parameter level, RL induces sparse and approximately orthogonal updates across tasks. The paper offers a theoretical account based on multi-task gradient interference.中国科学院自动化研究所的研究者发现,在多阶段训练下有监督微调会出现严重的任务冲突,而强化学习则让不同任务得以共存。追溯至参数层面,强化学习在各任务上产生稀疏且近似正交的更新。论文基于多任务梯度干扰给出了理论解释。中国科学院自動化研究所の研究者らは、多段階学習では教師ありファインチューニングが深刻なタスク間衝突を起こす一方、強化学習では多様なタスクが共存できると報告した。パラメータ単位で追跡すると、強化学習はタスクごとに疎かつほぼ直交する更新をもたらす。論文はマルチタスクの勾配干渉に基づく理論的説明を与える。
3Beyond Simply Environment Scaling: Designing Effective Environment Distributions for Multimodal Agent Learning超越单纯的环境规模扩张:为多模态智能体学习设计有效的环境分布単なる環境のスケーリングを超えて: マルチモーダルエージェント学習に効く環境分布の設計39 UPVOTES · KEJIAN ZHU ET AL. · CHINESE ACADEMIC OF SCIENCE INSTITUTE OF AUTOMATION · ARXIV 2608.03571Simply enlarging the pool of multimodal training environments does not always help agents, this group finds. They instead shape the distribution along two axes: Ability-aware Environment Selection picks diverse environment sets, while a difficulty structure controls how hard those environments are. The work argues distribution design matters more than raw environment count.该团队发现,单纯扩大多模态训练环境的数量并不总能让智能体受益。他们转而从两个维度调整环境分布:以"能力感知环境选择"获取多样的环境集合,并通过难度结构控制环境的难易分布。研究认为分布设计比环境数量本身更为关键。マルチモーダルな学習環境をただ増やしてもエージェントが必ず良くなるわけではない、と同グループは指摘する。代わりに分布を二つの軸で設計する。能力を考慮した環境選択で多様な環境集合を得て、難易度の構造でその難しさを制御する。環境の数そのものより分布の設計が重要だと論じている。
4Macaron-V1: Towards Open Continual Learning with Self-Improvement and Mixture-of-LoRAMacaron-V1:迈向自我改进与 Mixture-of-LoRA 的开放持续学习Macaron-V1: 自己改善と Mixture-of-LoRA による開かれた継続学習に向けて38 UPVOTES · MIND LAB ET AL. · MIND LAB · ARXIV 2608.09819Mind Lab releases Macaron-V1, an open agent-model family designed to keep learning from real environments after deployment. Adaptation works by recursively improving versioned model-harness pairs, with each configuration evaluated under an external contract to construct its successor. A Mixture-of-LoRA architecture freezes the base model and selects one specialist adapter per user turn.Mind Lab 发布 Macaron-V1,这是一个开放的智能体模型家族,目标是在部署之后仍能从真实环境中持续学习。其适应机制通过递归改进带版本的"模型—框架"配对实现,每种配置在外部契约下接受评估以构建后继版本。Mixture-of-LoRA 架构冻结基础模型,并在每轮对话中选择一个专家适配器。Mind Lab が、配備後も実環境から学び続けることを狙うオープンなエージェントモデル群 Macaron-V1 を公開した。適応はバージョン管理されたモデルとハーネスの組を再帰的に改善する形で進み、各構成は外部の契約のもとで評価され後継の構築に使われる。Mixture-of-LoRA 構成はベースモデルを凍結し、ユーザーのターンごとに専門アダプタを一つ選ぶ。
5Motif 3: Technical ReportMotif 3:技术报告Motif 3: テクニカルレポート23 UPVOTES · JUNGHWAN LIM ET AL. · MOTIF TECHNOLOGIES · ARXIV 2608.09119Motif Technologies details Motif 3, a decoder-only Mixture-of-Experts model with 314 billion total parameters and 13.2 billion active per token. Each sparse layer holds 384 routed experts with eight selected per token, giving large expert capacity at limited compute. The architecture centres on Grouped Differential Latent Attention, which pairs grouped differential attention with compressed key-value representations.Motif Technologies 详述了 Motif 3:一个仅含解码器的混合专家模型,总参数 3140 亿,每 token 激活 132 亿。每个稀疏层包含 384 个可路由专家,每 token 选取 8 个,在有限算力下提供庞大的专家容量。其架构核心是分组差分潜在注意力,将分组差分注意力与压缩的键值表示结合。Motif Technologies が、総パラメータ 3140 億・トークンあたり 132 億を活性化するデコーダ専用 Mixture-of-Experts モデル Motif 3 を解説した。各スパース層は 384 のルーティング専門家を持ち、トークンごとに 8 つを選ぶことで、限られた計算量で大きな専門家容量を確保する。中核となるのは、グループ化差分注意と圧縮された Key-Value 表現を組み合わせた Grouped Differential Latent Attention である。
2026-08-10 · MONDAY · 13:03 PDT
1StreamArena: Toward Continuous, Interactive, and Long-Horizon Agentic Streaming Video UnderstandingStreamArena:面向连续、交互式与长时程的智能体流式视频理解StreamArena: 連続的・対話的で長時間にわたるエージェント型ストリーミング動画理解に向けて14 UPVOTES · XICHEN ZHANG ET AL. · XIAOHONGSHU · ARXIV 2608.05703StreamArena is a benchmark for hour-scale interactive video understanding, built from 243 full-length videos averaging 88.8 minutes. The authors argue that current evaluations rely on short clips and multiple-choice formats, which let a baseline reading only the last four frames match far more complex streaming models.StreamArena 是一个面向小时级交互式视频理解的基准,由 243 段平均时长 88.8 分钟的完整视频构成。作者指出,现有评测多依赖短片段和多选题形式,以至于仅读取最后四帧的简单基线,就能与复杂得多的流式模型打成平手。StreamArena は、平均 88.8 分の全長動画 243 本で構成された、時間単位の対話的動画理解のためのベンチマークである。著者らは、既存の評価が短いクリップと多肢選択形式に依存しているため、最後の 4 フレームしか見ない単純なベースラインでも複雑なストリーミングモデルに匹敵してしまうと指摘する。
2DCAS: Decoupling CLI Agent Scaffolding to Internalize Planning across ScaffoldsDCAS:解耦 CLI 智能体脚手架,让规划能力跨脚手架内化DCAS: CLIエージェントのスキャフォールドを分離し、足場をまたいで計画能力を内在化する12 UPVOTES · KISHANTHAN THANGARAJAH ET AL. · CENTRE FOR SOFTWARE EXCELLENCE · ARXIV 2608.06113Open trajectory datasets for command line software engineering agents are collected almost entirely under one scaffold, OpenHands. The authors show that models fine-tuned on that data score well there but degrade under any other scaffold, while untrained base models do not, and trace the gap to learned planning structure.用于命令行软件工程智能体的开源轨迹数据集,几乎全部在 OpenHands 这一套脚手架下采集。作者发现,基于这些数据微调的模型在该脚手架上表现良好,换到其他脚手架却明显退化,而未经微调的基座模型不存在这种落差,并将差距归因于被学到的规划结构。コマンドライン型ソフトウェア工学エージェント向けの公開軌跡データセットは、そのほとんどが OpenHands という単一のスキャフォールド上で収集されている。著者らは、そのデータで微調整したモデルが同環境では高得点でも他のスキャフォールドでは大きく劣化する一方、未調整のベースモデルにはその差がないことを示し、原因を学習された計画構造に求めている。
3When Activation Oracles Learn Not to Read: Concept-Specific Blind Spots in Fine-Tuned Oracles当激活预言机学会不去读取:微调预言机中与概念相关的盲区活性化オラクルが「読まない」ことを学ぶとき: ファインチューニングされたオラクルの概念固有の盲点10 UPVOTES · TOBIAS BERSIA ET AL. · QUEEN MARY UNIVERSITY OF LONDON · ARXIV 2607.23379Activation oracles are language models trained to answer questions about another model's internal activations. This study argues they are learned systems rather than neutral readouts, and uses a controlled taboo word guessing setup to show concept-specific blind spots shaped by training data and reporting behaviour.激活预言机是一类被训练来回答另一模型内部激活状态问题的语言模型。该研究认为它们本身也是被训练出来的系统,而非中立的读数工具,并通过受控的禁忌词猜测实验,展示了由训练数据与汇报行为塑造出的、与特定概念相关的盲区。活性化オラクルとは、別のモデルの内部活性化について自然言語で答えるよう訓練された言語モデルである。本研究は、それが中立な読み出しではなく学習されたシステムであると論じ、統制されたタブーワード当ての設定を用いて、訓練データと報告の癖が生む概念固有の盲点を示している。
4Efficient Knowledge Distillation for LLMs: Offline Top-K Logits and a Fused Chunked KL Loss面向大模型的高效知识蒸馏:离线 Top-K logits 与融合分块 KL 损失LLMのための効率的な知識蒸留: オフラインTop-Kロジットと融合チャンク化KL損失9 UPVOTES · BAKBERGEN RYSKULOV ET AL. · MULTIVERSE COMPUTING · ARXIV 2608.03796Compressed small models are usually recovered through knowledge distillation, an expensive step that largely decides final quality. This practitioner study reports that offline distillation, caching a teacher's top-K logits once and training the student against that cache, matches online distillation at near-identical quality.压缩后的小模型通常要靠知识蒸馏来恢复能力,而这一步开销高昂,又在很大程度上决定最终质量。这项面向工程实践的研究表明,把教师模型的 top-K logits 缓存一次再让学生模型据此训练的离线蒸馏,质量几乎与在线蒸馏持平。圧縮された小型モデルは通常、知識蒸留によって性能を回復させるが、この工程は高コストでありながら最終的な品質をほぼ左右する。本研究は実務者の視点から、教師モデルの top-K ロジットを一度だけキャッシュして生徒を学習させるオフライン蒸留が、オンライン蒸留とほぼ同等の品質に達すると報告している。
5Douyin Multimodal Embedding Model Technical Report抖音多模态嵌入模型技术报告Douyin マルチモーダル埋め込みモデル技術報告7 UPVOTES · HAONAN CHEN ET AL. · BYTEDANCE · ARXIV 2608.02148ByteDance describes the multimodal embedding model behind search and recommendation on Douyin. The report frames the industrial constraint as needing both efficiency at billion-scale indexing and fine-grained discrimination, which it says contrastive models and chain-of-thought based models each satisfy only in part.字节跳动介绍了支撑抖音搜索与推荐的多模态嵌入模型。报告将工业场景的核心约束概括为:既要在十亿级索引规模下保持效率,又要具备细粒度的区分能力,而对比学习模型与基于思维链的模型各自只能满足其中一面。バイトダンスが、Douyin の検索・推薦を支えるマルチモーダル埋め込みモデルを解説した技術報告である。産業応用の要件を、十億規模のインデックスでの効率と細粒度の識別能力の両立と整理し、対照学習型モデルと思考連鎖型モデルはそれぞれ一方しか満たせないと論じている。
2026-08-08 · SATURDAY · 13:04 PDT
1AgentOPSD: Recursive Self-Distillation for Agentic Reinforcement LearningAgentOPSD:面向智能体强化学习的递归自蒸馏AgentOPSD: エージェント強化学習のための再帰的自己蒸留75 UPVOTES · ZI-HAN WANG ET AL. · TSINGHUA UNIVERSITY · ARXIV 2608.05987A Tsinghua-led team proposes AgentOPSD, a critic-free method for turn-level credit assignment in agentic reinforcement learning. It aggregates token-level log-probability gaps between a privileged teacher and the student policy, then applies that signal recursively so the few pivotal decisions in long-horizon, multi-turn tasks are credited. It is the day's most upvoted paper with 75 votes.清华大学牵头的团队提出 AgentOPSD,一种无需评论家网络、在智能体强化学习中按回合分配信用的方法。该方法先汇总特权教师与学生策略之间的 token 级对数概率差,再以递归方式传递该信号,使长时程多轮任务中真正关键的少数决策获得应有的信用。这是当日票数最高的论文,共 75 票。清華大学を中心とするチームは、エージェント強化学習でターン単位のクレジット割り当てを行う critic 不要の手法 AgentOPSD を提案した。特権的な教師と生徒方策のトークン単位の対数確率差を集約し、その信号を再帰的に伝播させることで、長期・多ターンのタスクで結果を左右する少数の決定的な判断を評価できるようにする。本日最多の 75 票を集めた。
2WorldClaw: Agentic 3D Open-World Generation at ScaleWorldClaw:大规模智能体式三维开放世界生成WorldClaw: 大規模なエージェント型3Dオープンワールド生成50 UPVOTES · CHUNCHAO GUO ET AL. · TENCENT HUNYUAN · ARXIV 2608.05248Tencent Hunyuan presents WorldClaw, a fully agentic coarse-to-fine framework that builds explorable 3D worlds from open-ended text. Planning agents turn a prompt into a structured specification of regions, terrain, assets, materials and spatial relations, which the system then realizes as a coherent scene with explicit assets suitable for editing and reuse.腾讯混元发布 WorldClaw,一个全流程由智能体驱动、从粗到细的框架,可根据开放式文本生成可自由探索的三维世界。规划智能体先把提示词转成关于区域、地形、资产、材质与空间关系的结构化规格,系统再据此构建全局连贯的场景,并输出可编辑、可复用的显式资产。テンセント混元は、自由記述のテキストから探索可能な3D世界を構築する、完全にエージェント駆動の粗密フレームワーク WorldClaw を発表した。プランニングエージェントがプロンプトを地域・地形・アセット・マテリアル・空間関係の構造化仕様に変換し、それをもとに全体として整合したシーンを、編集や再利用が可能な明示的アセットとして生成する。
3ChronoVision: Temporal Reasoning via Latent State ReconstructionChronoVision:通过潜在状态重建实现时序推理ChronoVision: 潜在状態の再構成による時間的推論33 UPVOTES · YIFAN SHEN ET AL. · PEDIAMED AI · ARXIV 2608.05631ChronoVision targets a known weakness of multimodal LLMs: strong passive perception but poor multi-step temporal reasoning, which the authors trace to the ambiguity of describing continuous visual change in words. During supervised fine-tuning, a reconstructive visual head predicts the latent representation of the final transformed state while an ROI attention module locates the regions that change.ChronoVision 针对多模态大模型的一个已知短板:被动感知很强,但多步时序推理很弱,作者将其归因于用语言描述连续视觉变化时的固有歧义。在监督微调阶段,重建式视觉头负责预测最终变换状态的潜在表示,同时 ROI 注意力模块定位发生变化的区域,使视觉逻辑与图像本身对齐。ChronoVision は、受動的な知覚には強い一方で多段階の時間的推論が苦手というマルチモーダル LLM の弱点に取り組む。著者らはその原因を、連続的な視覚変化を言語で表すことの曖昧さに求める。教師ありファインチューニングでは、再構成型のビジュアルヘッドが最終的な変換後状態の潜在表現を予測し、ROI アテンションモジュールが変化する領域を特定する。
4Learning from Failures: Retrieval-Centric CoT via Hard Negatives for Unified Multimodal Retrieval从失败中学习:面向统一多模态检索、基于难负例的检索导向思维链失敗から学ぶ: 統一マルチモーダル検索に向けたハードネガティブによる検索中心の CoT31 UPVOTES · ZELONG SUN ET AL. · DEEPGLINT · ARXIV 2608.06060DeepGlint researchers build chain-of-thought rationales for multimodal retrieval out of hard negatives rather than the query alone. Existing CoT retrievers explain what the query describes, which leaves vision-language models confusing semantically similar candidates; grounding the reasoning in near-misses surfaces the fine-grained cues that separate a true target from them.DeepGlint 的研究者不再只依据查询本身生成思维链,而是用难负例来构造多模态检索的推理过程。现有的思维链检索器只解释查询描述了什么,导致视觉语言模型容易混淆语义相近的候选;把推理建立在这些「差一点就对」的样本上,才能凸显区分真正目标的细粒度线索。DeepGlint の研究者らは、クエリだけに基づくのではなく、ハードネガティブからマルチモーダル検索の思考連鎖(CoT)を構築する。従来の CoT 検索器はクエリの内容を説明するにとどまり、視覚言語モデルは意味的に似た候補を取り違えてしまう。惜しくも外れた候補に推論を接地させることで、正解を切り分ける細かな手がかりが浮かび上がる。
5From Economic Agents to Agentic Economies: A Systems Blueprint for Economic World Models从经济智能体到智能体经济:经济世界模型的系统蓝图経済エージェントからエージェント経済へ: 経済世界モデルのためのシステム設計図28 UPVOTES · JIALE HAN ET AL. · FREEDOMAI · ARXIV 2608.06020A team from FreedomAI sets out an implementation roadmap for economic world models, generative systems that simulate an economy from the inside by modeling heterogeneous agents, their beliefs and actions, and the markets and institutions they interact through. The paper organizes such systems into a six-level capability ladder starting from fixed rule-based agents.FreedomAI 的团队提出了经济世界模型的实现路线图。这类生成式系统通过刻画异质智能体及其信念与行为,以及他们所处的市场与制度机制,从内部模拟经济的演化。论文把这类系统归纳为一个六级能力阶梯,起点是固定规则驱动的智能体。FreedomAI のチームが、経済世界モデルの実装ロードマップを提示した。これは異質なエージェントとその信念・行動、そして相互作用の場となる市場や制度をモデル化し、経済の動きを内側から生成的にシミュレートする仕組みである。論文はこうしたシステムを、固定ルールのエージェントを起点とする6段階の能力階梯として整理している。
2026-08-07 · FRIDAY · 13:06 PDT
1OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward ModelsOSReward:为跨平台计算机操作奖励模型建立标准化评测OSReward: クロスプラットフォームなコンピュータ操作報酬モデルの標準化評価49 UPVOTES · QIUSHI SUN ET AL. · NLP GROUP OF THE UNIVERSITY OF HONG KONG · ARXIV 2607.28609A 23-author team led from the University of Hong Kong introduces OSReward, a standardized evaluation for the vision-language models used to judge computer-use agent trajectories. The field increasingly relies on VLM judges because neither hand-written verifiers nor human annotators scale, yet whether those judges are reliable has gone largely unexamined.由香港大学牵头、共 23 位作者的团队提出 OSReward,为用于判定计算机操作智能体轨迹的视觉语言模型建立标准化评测。由于人工编写的验证器和人工标注都难以规模化,该领域越来越依赖 VLM 充当裁判,但这些裁判是否足够可靠,此前几乎无人系统检验。香港大学が主導する23人の著者チームが、コンピュータ操作エージェントの軌跡を判定する視覚言語モデル向けの標準化評価OSRewardを提案した。人手による検証器も人手アノテーションも規模化できないため、この分野はVLMを判定者として使う方向に進んでいるが、その信頼性はこれまでほとんど検証されてこなかった。
2Interpretable MEG Decoding of Perceived Speech: Cortical Sources and the Stimulus Features That Drive Retrieval可解释的感知言语 MEG 解码:皮层源与驱动检索的刺激特征知覚音声のMEG解読を解釈する: 皮質源と検索を駆動する刺激特徴36 UPVOTES · ILIA SEMENKOV ET AL. · ARXIV 2608.01481Deep networks can retrieve short segments of heard speech from non-invasive MEG recordings, but their weights do not correspond to any electrophysiological quantity. This paper redesigns both ends of a high-performing retrieval architecture, replacing spatial attention over a flattened sensor layout with spherical harmonics defined on the three-dimensional helmet geometry.深度网络可以从无创的脑磁图记录中检索出听到的短段语音,但其权重并不对应任何电生理量。该论文重新设计了一个高性能检索架构的前端与解码器,用定义在三维头盔几何上的球谐函数,取代了在展平传感器布局上做的空间注意力。深層ネットワークは非侵襲の脳磁図(MEG)記録から聞き取った短い音声区間を検索できるが、その重みは電気生理学的な量に対応していない。本論文は高性能な検索アーキテクチャのフロントエンドとデコーダの双方を作り替え、平坦化したセンサ配置上の空間アテンションを、三次元ヘルメット形状上で定義した球面調和関数に置き換えた。
3GST-Bench: Can VLMs Develop Global Spatial Awareness from Video?GST-Bench:视觉语言模型能否从视频中建立全局空间意识?GST-Bench: VLMは動画から全体的な空間認識を獲得できるか30 UPVOTES · QIFENG ZHANG ET AL. · BYTEDANCE SEED · ARXIV 2608.05747ByteDance Seed releases GST-Bench, a video question-answering benchmark for global spatial awareness rather than the local, few-viewpoint perception that existing tests measure. Its human-verified questions are drawn from 6,790 minutes of synthetically generated video and require models to reason about viewpoints never shown in the input.字节跳动 Seed 发布 GST-Bench,这是一个针对全局空间意识的视频问答基准,而非现有测试所衡量的单视角或少视角局部感知。其题目经人工核验,取自 6,790 分钟合成生成的视频,要求模型对输入中从未出现过的视角进行推理。ByteDance Seedは、既存のテストが測る単一・少数視点の局所的知覚ではなく、全体的な空間認識を問う動画QAベンチマークGST-Benchを公開した。設問は人手で検証され、合成生成された6,790分の動画から作られており、入力に現れない視点についての推論をモデルに求める。
4OneDayAgent: Towards a Long-Horizon Harness for Autonomous AgentsOneDayAgent:面向自主智能体的长程运行框架OneDayAgent: 自律エージェントのための長期タスク向けハーネス29 UPVOTES · JINGSHENG ZHENG ET AL. · ZJUNLP · ARXIV 2608.05013OneDayAgent is a harness for open-ended everyday requests that run long, cross several environments, and mix modalities. Prior work has attacked goal drift, state loss, and context overflow one at a time; the Zhejiang University group asks whether a single harness can handle all three at once and stay effective across different model backends.OneDayAgent 是一个面向开放式日常需求的运行框架,这类任务链条长、跨越多个环境且涉及多种模态。以往工作多是逐一应对目标漂移、状态丢失和上下文溢出,而浙江大学团队要问的是:单一框架能否同时处理这三者,并在不同底层模型上都保持有效。OneDayAgentは、長期にわたり複数の環境をまたぎ、複数のモダリティが混在する日常的で自由度の高い依頼に対応するハーネスである。従来研究は目標のずれ、状態の喪失、コンテキスト溢れを個別に扱ってきたが、浙江大学のグループは単一のハーネスで三つを同時に扱い、異なるモデル基盤でも有効性を保てるかを問う。
5EnvACE: Internalizing Environment Dynamics via World Rehearsal for Agentic Reinforcement LearningEnvACE:通过世界预演内化环境动态的智能体强化学习EnvACE: 世界リハーサルで環境ダイナミクスを内在化するエージェント強化学習28 UPVOTES · ZISHAN XU ET AL. · TENCENT · ARXIV 2608.06197Tencent's EnvACE trains tool-using agents without touching a real or simulated environment. The policy alternates between issuing a tool call and playing the environment that answers it, a loop the authors call world rehearsal, then conditions later decisions on its own rehearsed responses. The target is the cost of building and verifying executable training environments.腾讯提出的 EnvACE 在训练调用工具的智能体时,完全不接触真实或模拟环境。策略在发出工具调用与扮演回应该调用的环境之间交替,作者称之为世界预演,随后再基于自己预演出的回应做后续决策。其目标是压低构建与验证可执行训练环境的成本。テンセントのEnvACEは、実環境にもシミュレータにも触れずにツール利用エージェントを訓練する。方策はツール呼び出しと、それに応答する環境役を交互に演じ、著者らが世界リハーサルと呼ぶこのループで生成した応答を踏まえて以降の判断を行う。狙いは実行可能な訓練環境の構築と検証にかかるコストの削減である。
2026-08-06 · THURSDAY · 13:07 PDT
1ABSeeker: Training Long-Horizon Search Agents via Answer-Backtracked Credit AssignmentABSeeker:通过答案回溯信用分配训练长程搜索智能体ABSeeker:回答バックトラックによるクレジット割り当てで長期ホライズン検索エージェントを訓練する52 UPVOTES · YIJUN LU ET AL. · SHANGHAI JIAO TONG UNIVERSITY · ARXIV 2608.05102Researchers at Shanghai Jiao Tong University propose Answer-Backtracked Credit Assignment (ABC), a fine-grained framework for training long-horizon search agents. Rather than treating all steps in a trajectory uniformly during SFT and RL, ABC converts sparse trajectory-level outcomes into per-step credit, separating useful actions from erroneous or redundant ones. It drew 52 upvotes, the day's highest.上海交通大学的研究者提出答案回溯信用分配(ABC),一个用于训练长程搜索智能体的细粒度框架。不同于在 SFT 与 RL 中对轨迹内所有步骤一视同仁,ABC 将稀疏的轨迹级结果转化为逐步信用,以区分有用动作与错误或冗余动作。该论文获得 52 个赞,为当日最高。上海交通大学の研究者らが、長期ホライズンの検索エージェントを訓練するための細粒度フレームワーク「Answer-Backtracked Credit Assignment(ABC)」を提案。SFTとRLで軌跡内の全ステップを一律に扱うのではなく、疎な軌跡レベルの結果をステップ単位のクレジットに変換し、有用な行動と誤り・冗長な行動を区別する。本論文は当日最多の52アップボートを集めた。
2Towards Physics of Multimodal Pretraining: Knowledge Flow, Modality Synergy, Early Unification, and Recipes迈向多模态预训练的物理学:知识流动、模态协同、早期统一与配方マルチモーダル事前学習の物理へ:知識フロー、モダリティ相乗効果、早期統一、レシピ39 UPVOTES · JUNLIN HAN ET AL. · AI AT META · ARXIV 2608.05000Meta researchers run a systematic empirical exploration of natively unified multimodal pretraining. Controlled experiments on synthetic and large-scale real-world datasets yield four insights spanning knowledge flow, modality synergy, early unification, and training recipes, aiming to clarify a design space that unified training has so far left underexplored.Meta 的研究者对原生统一的多模态预训练进行了系统的实证探索。在合成与大规模真实数据集上的受控实验得出四条洞见,涵盖知识流动、模态协同、早期统一与训练配方,旨在厘清统一训练中迄今仍未充分探索的设计空间。Metaの研究者らが、ネイティブに統一されたマルチモーダル事前学習を体系的に実証研究した。合成データと大規模実データでの統制実験から、知識フロー、モダリティ相乗効果、早期統一、学習レシピにわたる4つの知見を導き、これまで未開拓だった設計空間の解明を目指す。
3Quo Vadis, World Modeling?世界建模,路在何方?世界モデリングはどこへ向かうのか31 UPVOTES · YU YANG ET AL. · SHANGHAI AI LABORATORY · ARXIV 2608.02713A 20-author team centered at Shanghai AI Laboratory takes stock of world modeling for continually improving agents. Arguing that classical future-state prediction is useful but narrow, the paper conceptualizes agent-centric interactive world models that give agents cheaper, more controllable feedback than direct real-environment interaction.以上海人工智能实验室为核心的 20 人作者团队梳理了面向持续改进智能体的世界建模。论文认为经典的未来状态预测有用但过于狭窄,进而提出以智能体为中心的交互式世界模型,为智能体提供比直接与真实环境交互更低成本、更可控的反馈。上海AIラボを中心とする20名の著者チームが、継続的に改善するエージェントのための世界モデリングを総括。従来の未来状態予測は有用だが狭いとし、実環境との直接対話よりも低コストで制御しやすいフィードバックをエージェントに与える、エージェント中心のインタラクティブ世界モデルを概念化した。
4PAST-Bench: Benchmarking the Foundations of Recursive Self-Improvement in Personal AgentsPAST-Bench:评测个人智能体递归自我改进的基础PAST-Bench:パーソナルエージェントにおける再帰的自己改善の基盤をベンチマークする28 UPVOTES · SHUHAN XUE ET AL. · PRINCETON UNIVERSITY · ARXIV 2608.04003Princeton researchers introduce PAST-Bench, a benchmark for whether personal AI agents actually improve from retained experience. Agents run ordered sequences of fresh-session tasks under matched conditions that switch retained experience on and off, spanning 26 scenarios, isolating the foundations of recursive self-improvement.普林斯顿大学的研究者推出 PAST-Bench,用于检验个人 AI 智能体是否真的能从留存经验中获得提升。智能体在开启与关闭留存经验的匹配条件下,按顺序执行一系列全新会话任务,覆盖 26 个场景,以隔离递归自我改进的基础能力。プリンストン大学の研究者らが、パーソナルAIエージェントが蓄積した経験から実際に改善するのかを検証するベンチマーク「PAST-Bench」を発表。エージェントは経験保持のオン・オフを揃えた条件下で新規セッションのタスク列を順に実行し、26のシナリオにわたって再帰的自己改善の基盤を切り分けて測定する。
5LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language ModelsLLaDA MoE v2:扩展混合专家扩散语言模型LLaDA MoE v2:Mixture-of-Experts拡散言語モデルのスケーリング27 UPVOTES · FENGQI ZHU ET AL. · GSAI-ML · ARXIV 2608.03457LLaDA MoE v2 characterizes how optimization hyperparameters, compute allocation, and architecture scale for mixture-of-experts diffusion language models. The study identifies quantitative differences from autoregressive scaling trends, including an optimal batch size that grows faster and an optimal learning rate that decays more rapidly with compute.LLaDA MoE v2 系统刻画了混合专家扩散语言模型在优化超参数、算力分配与架构上的扩展规律。研究发现其与自回归模型已知的扩展趋势存在量化差异,包括最优批大小随算力增长更快,而最优学习率随算力衰减更快。LLaDA MoE v2は、Mixture-of-Experts型拡散言語モデルにおける最適化ハイパーパラメータ、計算資源配分、アーキテクチャのスケーリング特性を体系的に明らかにした。自己回帰モデルで報告されてきた傾向との定量的な違いを特定しており、最適バッチサイズは計算量とともにより速く増加し、最適学習率はより急速に減衰するという。
2026-08-05 · WEDNESDAY · 13:07 PDT
1MerchantBench: Benchmarking LLM Agents for Long-Term Coherence in E-Commerce OperationsMerchantBench:面向电商运营长期一致性的LLM智能体基准MerchantBench:eコマース運営における長期一貫性を測るLLMエージェントベンチマーク83 UPVOTES · QIMING SHI ET AL. · ALIBABA · ARXIV 2607.28956Alibaba researchers present MerchantBench, a benchmark testing whether LLM agents stay coherent over long horizons in seller-side e-commerce operations. Agents run a persistent store where actions constrain future choices and feedback arrives at varying delays, so incoherent decisions accumulate into measurable costs. It targets a gap left by benchmarks built on bounded tasks with immediate success criteria.阿里巴巴研究团队提出MerchantBench,用于检验LLM智能体能否在卖家侧电商运营中长期保持连贯而有目的的行为。智能体在持久环境中经营店铺,行动会约束后续选择,反馈到达时间不一,不连贯的决策会累积成可衡量的损失。该基准填补了现有评测以短任务和即时成功标准为主的空白。アリババの研究チームは、販売者側のeコマース運営でLLMエージェントが長期にわたり一貫した行動を保てるかを検証するベンチマークMerchantBenchを発表した。エージェントは永続的な環境で店舗を運営し、行動が将来の選択を制約し、フィードバックは様々な遅延で届くため、一貫性を欠く判断は測定可能な損失として蓄積する。短期タスクと即時的な成功基準に偏った既存評価の空白を埋めるものだ。
2AURORA-LM: Autoencoding Unified Representation for Continuous-Latent Diffusion Language ModelingAURORA-LM:面向连续潜空间扩散语言建模的自编码统一表征AURORA-LM:連続潜在空間拡散言語モデリングのための自己符号化統一表現71 UPVOTES · JIAJUN LIANG ET AL. · NANJING UNIVERSITY · ARXIV 2608.02602Nanjing University researchers propose AURORA-LM, which generates text with diffusion in a continuous latent space rather than discrete tokens. Instead of compressing latents to ease diffusion, it keeps a high-capacity, decodable text latent and trains the diffusion model to learn its distribution directly, preserving token-level fidelity. The approach brings text closer to how images, video, and audio are modeled.南京大学研究者提出AURORA-LM,让文本生成在连续潜空间中通过扩散完成,而非依赖离散token。它不为迁就扩散模型而压缩潜表征,而是保留高容量、可解码的文本潜变量,并让扩散模型直接学习其分布,从而保持token级保真度。该方法使文本建模更接近图像、视频和音频的连续生成范式。南京大学の研究者らは、離散トークンではなく連続潜在空間での拡散によりテキストを生成するAURORA-LMを提案した。拡散を容易にするために潜在表現を圧縮するのではなく、高容量で復号可能なテキスト潜在を保持し、その分布を拡散モデルに直接学習させることでトークンレベルの忠実度を保つ。テキスト生成を画像・動画・音声と同様の連続的モデリングに近づける試みである。
3Hunyuan3D-Buffalo 1.0: A Unified Multimodal Model for Scalable 3D Generation, Understanding, and EditingHunyuan3D-Buffalo 1.0:面向可扩展3D生成、理解与编辑的统一多模态模型Hunyuan3D-Buffalo 1.0:スケーラブルな3D生成・理解・編集のための統一マルチモーダルモデル70 UPVOTES · JUNLIANG YE ET AL. · TENCENT HUNYUAN · ARXIV 2608.02711Tencent Hunyuan presents Hunyuan3D-Buffalo 1.0, a single architecture unifying 3D understanding, text-to-3D generation, instruction-guided 3D editing, and text-grounded part generation. To overcome the shortage of geometrically consistent editing data, the team built an 87-million-scale 3D multimodal dataset for training. It extends the unified-model trend from images into 3D content creation.腾讯混元发布Hunyuan3D-Buffalo 1.0,用单一架构统一3D理解、文本生成3D、指令引导3D编辑和文本定位的部件生成。为解决几何一致的编辑数据稀缺问题,团队构建了8700万规模的3D多模态数据集用于训练。它将图像领域的统一模型趋势延伸到3D内容创作。テンセント混元は、3D理解、テキストからの3D生成、指示に基づく3D編集、テキストに紐づくパーツ生成を単一アーキテクチャで統合するHunyuan3D-Buffalo 1.0を発表した。幾何的に一貫した編集データの不足を補うため、8700万規模の3Dマルチモーダルデータセットを構築して学習に用いた。画像で進む統一モデルの潮流を3D制作へと広げる成果だ。
4VAD: Attributing Visual Evidence for Target Reconstruction in Multimodal On-Policy DistillationVAD:多模态在线策略蒸馏中目标重建的视觉证据归因VAD:マルチモーダル・オンポリシー蒸留における目標再構成の視覚的証拠帰属43 UPVOTES · KANGNING ZHANG ET AL. · ARXIV 2607.28590This paper introduces Visual Attribution Distillation for multimodal on-policy distillation, where a privileged teacher corrects student-generated trajectories. Because the teacher's next-token corrections mix visual signals with linguistic priors and teacher-specific effects, VAD uses counterfactual target reconstruction to estimate which part of each correction is actually supported by visual evidence.该论文提出视觉归因蒸馏(VAD),用于多模态在线策略蒸馏,即由特权视角教师纠正学生自生成的轨迹。由于教师的逐token纠正混杂了视觉信号、语言先验和教师自身偏差,VAD通过反事实目标重建来估计每次纠正中真正由视觉证据支撑的部分。本論文はマルチモーダル・オンポリシー蒸留向けのVisual Attribution Distillation(VAD)を提案する。特権的な視点を持つ教師が生徒の生成軌跡を修正する枠組みだが、その修正には視覚信号に加えて言語的事前知識や教師固有の影響が混在する。VADは反実仮想の目標再構成により、修正のうち視覚的証拠に裏付けられた部分を推定する。
5Video-DeepResearch: Towards the Next-Generation Multimodal Deepresearch AgentVideo-DeepResearch:迈向下一代多模态深度研究智能体Video-DeepResearch:次世代マルチモーダル・ディープリサーチエージェントへ43 UPVOTES · ZHEN FANG ET AL. · ARXIV 2608.03979Video-DeepResearch extends multimodal research agents from static images to continuous video streams, pairing dense spatiotemporal grounding with open-web exploration. The authors identify two bottlenecks in current models, a bias toward textual search over visual tools and reliance on parametric memory instead of genuine tool use, and address them with a decoupled perception-exploration pipeline.Video-DeepResearch将多模态研究智能体从静态图像扩展到连续视频流,把稠密的时空定位与开放网络探索结合起来。作者指出当前模型的两大瓶颈:偏向文本搜索而绕开视觉工具的模态偏差,以及依赖参数化记忆而非真实工具执行的知识泄漏,并用解耦的感知-探索流水线加以解决。Video-DeepResearchはマルチモーダル研究エージェントを静止画像から連続的な動画ストリームへ拡張し、密な時空間グラウンディングとオープンウェブ探索を組み合わせる。著者らは現行モデルの二つのボトルネック、視覚ツールを避けて文字検索に頼るモダリティバイアスと、実際のツール実行ではなく内部記憶に依存する知識漏出を指摘し、知覚と探索を分離したパイプラインで対処する。
2026-08-04 · TUESDAY · 13:04 PDT
1DAPD: Dual-Anchored Policy DistillationDAPD:双锚定策略蒸馏DAPD:デュアルアンカー方策蒸留54 UPVOTES · JIANYU WU ET AL. · SHANGHAI AI LABORATORY · ARXIV 2608.01735Researchers at Shanghai AI Laboratory identify a privilege illusion in on-policy distillation: students trained against privileged teachers learn behavior they cannot reproduce from their inference-time context. The paper traces the failure to information asymmetry between teacher and student and proposes Dual-Anchored Policy Distillation to resolve it.上海人工智能实验室的研究者指出了在线策略蒸馏中的“特权幻觉”:以持有特权信息的教师训练出的学生,会学到无法在推理时上下文中复现的行为。论文将这一失效归因于教师与学生之间的信息不对称,并提出双锚定策略蒸馏(DAPD)来加以解决。上海 AI 研究所の研究チームは、オンポリシー蒸留における「特権の幻想」を指摘した。特権情報を持つ教師で訓練された生徒モデルは、推論時のコンテキストからは再現できない挙動を学習してしまう。論文はこの失敗の根本原因を教師と生徒の情報非対称性に求め、解決策としてデュアルアンカー方策蒸留(DAPD)を提案する。
2Progressive Agent Skill Generation via Reinforcement Learning基于强化学习的渐进式智能体技能生成強化学習による漸進的エージェントスキル生成49 UPVOTES · JUNHAO SHEN ET AL. · THE CHINESE UNIVERSITY OF HONG KONG - DATABASE GROUP · ARXIV 2608.01678Skill-alpha frames agent skill generation as a reinforcement learning problem instead of relying on hand-designed heuristics or pipeline-style consolidation. Because skills lack a natural supervision signal for relevance or correctness, the method scores them by whether they improve the agent's behavior on downstream tasks.Skill-alpha 将智能体技能生成建模为强化学习问题,而非依赖人工设计的启发式规则或流水线式整合。由于技能缺乏基于相关性或正确性的天然监督信号,该方法以技能能否改善智能体在下游任务上的表现来评定其价值。Skill-alpha は、人手で設計したヒューリスティクスやパイプライン型の統合に頼らず、エージェントのスキル生成を強化学習の問題として定式化する。スキルには関連性や正しさに基づく自然な教師信号が無いため、下流タスクでエージェントの挙動を改善できるかどうかでスキルの価値を評価する。
3Meshy T2: Fast Native Mesh Generation with Flow MatchingMeshy T2:基于流匹配的快速原生网格生成Meshy T2:フローマッチングによる高速ネイティブメッシュ生成47 UPVOTES · JIALE XU ET AL. · MESHY · ARXIV 2607.28675Meshy T2 is a native mesh generation framework built on flow matching, aimed at producing artist-style topology fast enough for interactive 3D asset creation. At its core, a vertex-set mesh VAE encodes a mesh into one continuous latent token per vertex, sidestepping the slow, error-prone autoregressive token decoding of mainstream approaches.Meshy T2 是一个基于流匹配的原生网格生成框架,目标是以足够快的速度生成具有美术师风格拓扑的网格,满足交互式 3D 资产创作需求。其核心是一个顶点集网格 VAE,将网格编码为每个顶点一个连续潜在 token,从而绕开主流方法中缓慢且易累积误差的自回归 token 解码。Meshy T2 はフローマッチングに基づくネイティブメッシュ生成フレームワークで、インタラクティブな 3D アセット制作に耐える速度でアーティスト品質のトポロジーを生成することを狙う。中核となる頂点集合メッシュ VAE がメッシュを頂点ごとに 1 つの連続潜在トークンへ符号化し、主流手法の遅く誤差が蓄積しやすい自己回帰的トークンデコードを回避する。
4UEmbed: Unified Sparse and Dense Multimodal EmbeddingsUEmbed:统一的稀疏与稠密多模态嵌入UEmbed:疎と密を統一したマルチモーダル埋め込み41 UPVOTES · TINGYU SONG ET AL. · ALIBABA-NLP · ARXIV 2608.02583UEmbed is a decoder-only multimodal embedding model from Alibaba-NLP that produces both sparse lexical and dense representations in a single causal forward pass. It extends learned sparse retrieval beyond encoder-style bidirectional architectures and drops the auxiliary cross-modal modules earlier multimodal systems leaned on.UEmbed 是 Alibaba-NLP 推出的仅解码器多模态嵌入模型,在一次因果前向计算中同时产出稀疏词汇表示和稠密表示。它将学习式稀疏检索从编码器式双向架构中解放出来,并去掉了此前多模态系统所依赖的辅助跨模态模块。UEmbed は Alibaba-NLP によるデコーダのみのマルチモーダル埋め込みモデルで、1 回の因果的フォワードパスで疎な語彙表現と密な表現の両方を生成する。学習型スパース検索をエンコーダ型双方向アーキテクチャの制約から解き放ち、従来のマルチモーダルシステムが頼っていた補助的なクロスモーダルモジュールも不要にした。
5AISPA: User-Centric System Prompt Auditing for Large Language Model ApplicationsAISPA:面向大语言模型应用的以用户为中心的系统提示词审计AISPA:LLM アプリケーションのユーザー中心システムプロンプト監査34 UPVOTES · XIANGNING LIN ET AL. · STANFORD UNIVERSITY · ARXIV 2607.28617Stanford researchers introduce AISPA, a user-centric framework for systematically auditing the system prompts that govern commercial AI applications. It evaluates parts of a prompt along eight dimensions that matter to users, targeting the trust and accountability gap created by prompts that are rarely disclosed to the public or regulators.斯坦福研究者提出 AISPA,一个以用户为中心、系统化审计商业 AI 应用系统提示词的框架。它沿用户关切的八个维度评估提示词的各个部分,旨在弥合系统提示词极少向公众或监管者披露所造成的信任与问责缺口。スタンフォード大学の研究チームが AISPA を提案。商用 AI アプリケーションを制御するシステムプロンプトを体系的に監査する、ユーザー中心のフレームワークだ。プロンプトの各部分をユーザーにとって重要な 8 つの観点で評価し、システムプロンプトが一般にも規制当局にもほとんど開示されないことで生じる信頼性と説明責任のギャップに切り込む。