1Mental World Modeling心智世界建模メンタル世界モデリング52 UPVOTES · HAO FEI ET AL. · MENTAL WORLD MODEL · ARXIV 2607.27201The paper proposes Mental World Modeling, a framework that makes hidden mental states such as beliefs, desires, intentions, and feelings core variables of a world model. The authors argue that a model tracking only the physical scene predicts the wrong action for the right-looking scene, since human behavior is driven by what agents know and believe rather than by the scene alone.论文提出心智世界建模(MWM),一个将信念、欲望、意图和情感等隐藏心智状态作为世界模型核心变量的通用理论框架。作者认为,只跟踪物理场景的模型会在看似正确的场景下预测出错误的行动,因为人类行为由主体的认知与信念驱动,而非仅由场景本身决定。本論文は、信念・欲求・意図・感情といった隠れた心的状態を世界モデルの中核変数とする枠組み「メンタル世界モデリング(MWM)」を提案する。物理的シーンだけを追跡するモデルは、見た目には正しいシーンに対して誤った行動を予測してしまうと著者らは論じる。人間の行動はシーンそのものではなく、各主体が何を知り何を信じているかによって駆動されるためである。
2N_0-TWAM: Scaling Tactile-Native World-Action Model for Contact-Rich ManipulationN_0-TWAM:面向富接触操作的触觉原生世界-行动模型规模化N_0-TWAM:接触の多い操作に向けた触覚ネイティブ世界行動モデルのスケーリング26 UPVOTES · NEOTEAI TEAM ET AL. · NEOTEAI · ARXIV 2607.23783NeoteAI presents N_0-TWAM, a tactile-native world-action model for contact-rich manipulation that predicts both future vision and future contact. It is pre-trained with visuo-tactile joint training on demonstrations spanning six embodiments and 450 tasks, using the force-based NeoForce representation to condition action generation. The authors call it the first such model trained at large scale.NeoteAI 发布 N_0-TWAM,一个面向富接触操作的触觉原生世界-行动模型,可同时预测未来视觉和未来接触。模型在覆盖 6 种具身形态、450 项任务的演示数据上进行大规模视觉-触觉联合预训练,并使用基于力的统一触觉表征 NeoForce,将动作生成建立在物理接触信号之上。作者称这是首个大规模训练的触觉世界-行动模型。NeoteAI は、接触の多い操作向けに将来の視覚と将来の接触の両方を予測する触覚ネイティブ世界行動モデル N_0-TWAM を発表した。6 種類のエンボディメントと 450 タスクにわたるデモデータで視覚・触覚の共同学習による大規模事前学習を行い、力ベースの統一触覚表現 NeoForce により行動生成を物理的な接触信号に接地させている。著者らはこれを大規模学習された初の触覚世界行動モデルだとしている。
3SAF-OPD: Stable Advantage Fusion for On-Policy DistillationSAF-OPD:面向同策略蒸馏的稳定优势融合SAF-OPD:オンポリシー蒸留のための安定アドバンテージ融合23 UPVOTES · YIFAN DING ET AL. · ARXIV 2607.29209The paper combines RL with verifiable rewards, which spreads one sparse reward across all tokens, and on-policy distillation, which scores each token against a stronger teacher but caps performance at teacher quality. The authors show that fusing the two advantages with a fixed coefficient triggers entropy collapse, and propose Stable Advantage Fusion to fix the underlying miscalibrations.论文研究如何结合可验证奖励强化学习与同策略蒸馏:前者将单一响应级奖励广播到每个 token,后者用更强教师对每个 token 稠密打分,但性能上限受制于教师水平。作者发现用固定系数融合两种优势会引发熵坍缩,并将其归因于校准失衡,例如 token 级蒸馏优势可能远超有界的 RL 优势并淹没其信号,进而提出稳定的融合方法。本論文は、単一の応答レベル報酬を全トークンに一律に与える検証可能報酬付き強化学習(RLVR)と、より強力な教師に対して各トークンを密に採点する一方で性能が教師の水準で頭打ちになるオンポリシー蒸留(OPD)の組み合わせを研究する。固定係数で両者のアドバンテージを融合するとエントロピー崩壊が起きることを発見し、トークンレベルの蒸留アドバンテージが有界な RL アドバンテージを大きく上回り信号をかき消すといった較正のずれに原因を特定した上で、安定した融合手法を提案する。
4Scaling Properties of Text Conditioning in Visual Generation视觉生成中文本条件化的规模化特性視覚生成におけるテキスト条件付けのスケーリング特性23 UPVOTES · ZILONG CHEN ET AL. · BYTEDANCE SEED · ARXIV 2607.29679ByteDance Seed researchers measure how text conditioning scales in visual generation, a question rarely studied because diffusion loss does not scale with prompt token count. They find that converged diffusion loss scales with the amount of structured language in the prompt, decreasing approximately linearly with a likelihood-based measure of prompt structure across controlled training runs.字节跳动 Seed 团队测量了视觉生成中文本条件化的经验规模化特性。这一问题此前很少被研究,因为扩散损失并不随提示词 token 数量而变化。他们发现收敛后的扩散损失与提示中结构化语言的数量相关,并用白盒似然指标和黑盒属性指标加以量化:在受控训练中,损失随似然指标近似线性下降。ByteDance Seed の研究者らは、視覚生成におけるテキスト条件付けの経験的なスケーリング特性を測定した。拡散損失はプロンプトのトークン数に比例して変化しないため、この問題はこれまでほとんど研究されてこなかった。彼らは、収束後の拡散損失がプロンプト内の構造化言語の量に応じてスケールすることを発見し、ホワイトボックスの尤度指標とブラックボックスの属性指標で定量化した。統制された学習実験では、損失は尤度指標に対しほぼ線形に減少した。
5Fewer Clarifications, Better Code: Benchmarking Cross-Session Personalized Ambiguity Adaptation in Coding Assistants更少澄清、更好代码:编码助手跨会话个性化歧义适应基准少ない確認でより良いコードを:コーディングアシスタントのセッション横断的なパーソナライズド曖昧性適応のベンチマーク19 UPVOTES · ZIJIAN XU ET AL. · HKUST · ARXIV 2607.26611HKUST researchers formulate personalized ambiguity adaptation as a new task for coding assistants: using a user's resolved session history as memory to disambiguate recurring, user-specific ambiguities in new sessions. Existing methods handle each ambiguous request in isolation, typically by asking clarifying questions, and the benchmark tests whether assistants can instead learn a user's patterns across sessions.香港科技大学的研究者将个性化歧义适应定义为编码助手的一项新任务:利用用户已解决的历史会话作为记忆,在新会话中消解反复出现、因人而异的歧义。现有方法通常孤立处理每个含糊请求并依赖追加澄清提问,该基准则检验助手能否跨会话学习用户的个人模式。香港科技大学(HKUST)の研究者らは、パーソナライズド曖昧性適応をコーディングアシスタントの新タスクとして定式化した。ユーザーの解決済みセッション履歴をメモリとして活用し、新しいセッションで繰り返し現れるユーザー固有の曖昧さを解消するというものである。既存手法は曖昧なリクエストを個別に扱い、追加の確認質問に頼ることが多いが、このベンチマークはアシスタントがセッションを越えてユーザーのパターンを学習できるかを検証する。
2026-08-01 · SATURDAY · 13:03 PDT
1MPIE-Bench: Benchmarking Anatomically Plausible Multi-Person Interaction EditingMPIE-Bench:解剖学上合理的多人交互编辑基准评测MPIE-Bench:解剖学的に妥当な複数人物インタラクション編集のベンチマーク37 UPVOTES · JIAJIA LIN ET AL. · MUSET.AI · ARXIV 2607.27616Researchers introduce MPIE-Bench, a 2,500-sample benchmark for editing multiple named people into shared contact actions such as embracing or carrying. Built from video-mined editing triplets across 405 scenes and 14 interaction categories, it targets failures like fused limbs and interpenetrating bodies that VLM-judge checklists miss but humans spot easily.研究者提出 MPIE-Bench,一个包含 2500 个样本的基准,评测把多位指定人物编辑进拥抱、搬抱等身体接触动作的能力。基准由视频挖掘的编辑三元组构成,覆盖 405 个场景和 14 类交互,专门针对肢体融合、身体穿插等 VLM 评审清单会漏掉但人类一眼可见的失败模式。研究チームは、複数の特定人物を抱擁や抱き上げなどの接触動作へ編集する能力を評価する 2,500 サンプルのベンチマーク MPIE-Bench を提案した。動画から採掘した編集トリプレットで構成され、405 シーン・14 種類のインタラクションをカバーし、VLM 審査のチェックリストでは見逃されるが人間には明白な、肢体の融合や身体の貫通といった失敗を対象とする。
2ACE-Data-0: Human-Centric Ambient Capture as Embodied Data EngineACE-Data-0:以人为中心的环境捕捉作为具身数据引擎ACE-Data-0:人間中心のアンビエントキャプチャによる身体性データエンジン34 UPVOTES · YUKANG CAO ET AL. · ARXIV 2607.28625The Ambient Capture Engine (ACE) turns real home environments into spatially calibrated, temporally synchronized recording studios for embodied AI data. It addresses the field's data bottleneck by capturing first-person perception, whole-body motion, dexterous manipulation, object state, sound, and touch together as humans pursue goals over time.Ambient Capture Engine(ACE)把真实的家居环境改造成空间标定、时间同步的录制工作室,用于采集具身智能数据。它同步记录人类在长时间目标行为中的第一人称感知、全身运动、灵巧操作、物体状态、声音和触觉,以解决该领域的数据瓶颈。Ambient Capture Engine(ACE)は、実際の住宅環境を空間的に校正され時間同期された収録スタジオに変え、身体性 AI のデータを収集する。人間が目標を追う過程での一人称視点の知覚、全身運動、巧緻な操作、物体の状態、音、触覚を一体で捉え、この分野のデータボトルネックの解消を狙う。
3Beyond Borrowed Histories: Person-Aligned User Simulation for Interactive Role-Playing Evaluation超越借用的历史:面向交互式角色扮演评测的人格对齐用户模拟借り物の履歴を超えて:対話型ロールプレイ評価のための人物整合ユーザーシミュレーション30 UPVOTES · YUHANG ZHU ET AL. · MUSET.AI · ARXIV 2607.27816This paper targets evaluation of role-playing agents, one of the biggest consumer uses of LLMs. Arguing that continuing a fixed dialogue history under a fixed rubric misjudges systems, the authors propose person-aligned user simulation so agents are scored in interactive conversations shaped by the simulated user rather than borrowed transcripts.这篇论文关注角色扮演智能体的评测——这是大语言模型最大的消费级应用之一。作者指出,让智能体续写固定对话历史再按固定量规打分会造成误判,因此提出人格对齐的用户模拟,让智能体在由模拟用户塑造的交互式对话中接受评测,而非依赖借来的对话记录。本論文は、LLM の最大級のコンシューマー用途であるロールプレイエージェントの評価を扱う。固定された対話履歴の続きを固定ルーブリックで採点する方式では正しく評価できないとし、人物に整合したユーザーシミュレーションを提案。借り物のログではなく、シミュレートされたユーザーが形作る対話の中でエージェントを評価する。
4RefCaptioner: Multi-Reference Image-Grounded Video CaptioningRefCaptioner:多参考图像锚定的视频描述生成RefCaptioner:複数参照画像に基づく動画キャプション生成25 UPVOTES · TENGFEI LIU ET AL. · KLING TEAM · ARXIV 2607.28509The Kling team introduces multi-reference image-grounded video captioning, a task requiring factual video descriptions with phrase-level grounding to reference images. RefCaptioner, a two-stage post-training framework combining mixed-data SFT with Hierarchical Coverage-Discounted GRPO, improves reference selection, phrase binding, and distractor rejection.可灵团队提出多参考图像锚定的视频描述任务,要求生成的视频描述在短语级别与参考图像对应且符合事实。RefCaptioner 是一个两阶段后训练框架,将混合数据 SFT 与分层覆盖折扣 GRPO 相结合,提升了参考选择、短语绑定和干扰项排除能力。Kling チームは、参照画像へのフレーズ単位のグラウンディングを伴う事実に即した動画記述を求める新タスク「複数参照画像に基づく動画キャプション生成」を提案した。RefCaptioner は混合データ SFT と階層的カバレッジ割引 GRPO を組み合わせた2段階のポストトレーニング枠組みで、参照の選択、フレーズの対応付け、ディストラクタの排除を改善する。
5See2Think: Do Multimodal Models Really Use Intermediate Visual States?See2Think:多模态模型真的在利用中间视觉状态吗?See2Think:マルチモーダルモデルは中間視覚状態を本当に活用しているのか22 UPVOTES · SIYU YAN ET AL. · ARXIV 2607.26769See2Think asks whether multimodal models that sketch, annotate, and generate intermediate images during reasoning actually rely on those visual states. The framework pairs See2ThinkBench, 1,200 open-ended visual tasks, with a Visual Action-of-Thought protocol that diagnoses how intermediate visual states are generated, rendered, and used rather than only scoring final answers.See2Think 追问一个问题:在推理中绘制草图、做标注、生成中间图像的多模态模型,是否真的依赖这些视觉状态。该框架由包含 1200 个开放式视觉任务的 See2ThinkBench 和视觉思维行动(VAoT)协议组成,不只评判最终答案,而是诊断中间视觉状态如何被生成、渲染和使用。See2Think は、推論中にスケッチや注釈、中間画像を生成するマルチモーダルモデルが、その視覚状態に本当に依存しているのかを問う。1,200 件のオープンエンドな視覚タスクからなる See2ThinkBench と、最終回答の採点にとどまらず中間視覚状態の生成・描画・利用を診断する Visual Action-of-Thought プロトコルを組み合わせた評価フレームワークだ。
2026-07-31 · FRIDAY · 13:05 PDT
1Qwen-UI-Agent Technical Report: Toward Next-Generation Real-World Centric Foundation GUI AgentsQwen-UI-Agent 技术报告:迈向下一代面向真实世界的基础 GUI 智能体Qwen-UI-Agent 技術報告:次世代の実世界中心の基盤 GUI エージェントに向けて264 UPVOTES · HANZHANG ZHOU ET AL. · TONGYILAB · ARXIV 2607.28227TongyiLab presents Qwen-UI-Agent, a real-world centric foundation GUI agent spanning mobile, computer-use, web, and DeepSearch environments. The report targets agents that operate reliably on real devices, combine GUI interaction with CLI execution, and complete long-horizon tasks while improving with minimal human effort. It leads the day's Hugging Face papers with 264 upvotes.通义实验室发布 Qwen-UI-Agent,一个面向真实世界的基础 GUI 智能体,覆盖移动端、计算机操作、网页和 DeepSearch 环境。报告的目标是让智能体在真实设备上可靠运行、将 GUI 交互与 CLI 执行结合、完成长程任务,并以最少的人工投入自我提升。该论文以 264 个赞领跑当日 Hugging Face 论文榜。TongyiLab は、モバイル、コンピュータ操作、ウェブ、DeepSearch の各環境にまたがる実世界中心の基盤 GUI エージェント Qwen-UI-Agent を発表した。実機で確実に動作し、GUI 操作と CLI 実行を組み合わせ、長期タスクを完遂しながら最小限の人手で自己改善するエージェントを目指す。264 の賛成票で当日の Hugging Face 論文で首位に立った。
2Metis: Memory Foundation ModelMetis:记忆基础模型Metis:メモリ基盤モデル213 UPVOTES · ZEYU ZHANG ET AL. · MEMTENSOR · ARXIV 2607.26760MemTensor introduces memory foundation models, which build native memory capability directly into foundation models instead of relying on external memory modules. The work formalizes native memory in part as a persistent, dynamically evolving memory state, taking a first step toward agents that remember by design rather than by bolted-on retrieval.MemTensor 提出记忆基础模型,将原生记忆能力直接构建进基础模型,而不是依赖外部记忆模块。这项工作将原生记忆部分形式化为一种持久且动态演化的记忆状态,朝着让智能体凭设计本身而非外挂检索来记忆迈出第一步。MemTensor は、外部メモリモジュールに頼らず基盤モデル自体にネイティブな記憶能力を組み込む「メモリ基盤モデル」を提唱した。ネイティブメモリを持続的かつ動的に進化する記憶状態などとして形式化し、後付けの検索ではなく設計そのものによって記憶するエージェントへの第一歩を示している。
3AskChem: Claim-Centered Infrastructure for Chemistry Literature SynthesisAskChem:面向化学文献综合的以论断为中心的基础设施AskChem:化学文献統合のためのクレーム中心インフラ199 UPVOTES · BING YAN ET AL. · NEW YORK UNIVERSITY · ARXIV 2607.28618NYU researchers present AskChem, a claim-centered infrastructure for cross-paper chemistry search. Instead of returning ranked document lists, it converts each paper into atomic, typed claims grounded by a source DOI, so scientists and AI agents can assemble cross-paper answers with verifiable provenance.纽约大学的研究者提出 AskChem,一个以论断为中心的跨论文化学检索基础设施。它不再返回按相关性排序的文献列表,而是把每篇论文转化为带来源 DOI 的原子化、类型化论断,让科学家和 AI 智能体能够组装出来源可验证的跨论文答案。ニューヨーク大学の研究者らは、論文横断の化学検索のためのクレーム中心インフラ AskChem を発表した。ランク付けした文献リストを返す代わりに、各論文を出典 DOI に紐づいた原子的で型付きのクレームへ変換し、科学者や AI エージェントが出所を検証できる論文横断の回答を組み立てられるようにする。
4PhiZero: A World Model Built Around Physical LanguagePhiZero:围绕物理语言构建的世界模型PhiZero:物理言語を中心に構築された世界モデル148 UPVOTES · SHUYAO SHANG ET AL. · ARXIV 2607.28624PhiZero is a physical world model built around physical language, a compact discrete representation of world-state transitions learned from in-the-wild videos via self-supervision. Rather than predicting future video directly in pixel space, it uses this representation to reason explicitly about how the physical world evolves.PhiZero 是一个围绕物理语言构建的物理世界模型——物理语言是对世界状态转移的紧凑离散表示,通过自监督从真实场景视频中学得。它不在像素空间直接预测未来视频,而是利用这一表示对物理世界的演化进行显式推理。PhiZero は「物理言語」を中心に構築された物理世界モデルである。物理言語とは世界状態の遷移を表す簡潔な離散表現で、実世界の動画から自己教師あり学習で獲得される。ピクセル空間で未来の映像を直接予測するのではなく、この表現を用いて物理世界の変化を明示的に推論する。
5Frontis-MA1: Training an AI4AI Model towards Recursive Self-Improvement in Machine Learning EngineeringFrontis-MA1:训练面向机器学习工程递归自我改进的 AI4AI 模型Frontis-MA1:機械学習エンジニアリングにおける再帰的自己改善を目指す AI4AI モデルの訓練121 UPVOTES · JUNLIN YANG ET AL. · FRONTIS AI · ARXIV 2607.28568Frontis AI post-trains Frontis-MA1, a 35B meta-evolution agent for machine learning engineering, on OpenMLE, an open full-stack system for recursive self-improvement research. The stack spans verifiable task environments with execution feedback, operator learning, and long-horizon search, treating MLE as a concrete testbed for AI that improves the process of building AI.Frontis AI 在 OpenMLE 上后训练了 Frontis-MA1,一个面向机器学习工程的 35B 元进化智能体;OpenMLE 是用于递归自我改进研究的开放全栈系统。该体系涵盖带执行反馈的可验证任务环境、算子学习和长程搜索,把机器学习工程当作 AI 改进 AI 构建过程的具体试验场。Frontis AI は、再帰的自己改善研究のためのオープンなフルスタックシステム OpenMLE 上で、機械学習エンジニアリング向けの 35B メタ進化エージェント Frontis-MA1 をポストトレーニングした。実行フィードバック付きの検証可能なタスク環境、オペレータ学習、長期探索を備え、機械学習エンジニアリングを AI が AI 構築のプロセスを改善するための具体的なテストベッドと位置づけている。
2CoRT: Counterfactual Replay for Token-Level Rubric-Guided Policy OptimizationCoRT:面向 token 级评分标准引导策略优化的反事实回放CoRT - トークン単位のルーブリック誘導型方策最適化のための反実仮想リプレイ73 UPVOTES · BO-WEN ZHANG ET AL. · BYTEDANCE · ARXIV 2607.25659Rubric-based reinforcement learning grades model outputs against explicit written criteria, but GRPO-style pipelines flatten those judgments into a single response-level number. CoRT uses counterfactual replay to push the rubric signal down to individual tokens.基于评分标准的强化学习,会按明确写出的准则来评判模型输出;但在 GRPO 式流水线中,这些结构化判断最终被压成一个响应级的标量奖励。CoRT 用反事实回放把评分信号下沉到单个 token 层面。ルーブリックに基づく強化学習は、明示的に書かれた基準に照らしてモデル出力を評価する。しかし GRPO 型のパイプラインでは、その構造化された判断が応答単位のスカラー報酬へと押し潰されてしまう。CoRT は反実仮想リプレイによって、ルーブリックの信号を個々のトークンにまで届かせる。
3HumanCLAW: Can Vision-Language Models Act Through a Body?HumanCLAW:视觉-语言模型能否通过一具身体去行动?HumanCLAW - 視覚言語モデルは身体を通じて行動できるか65 UPVOTES · SIYAO LI ET AL. · META RESEARCH · ARXIV 2607.27180Judging whether a vision-language model can act through a physical body is hard because the outcome mixes the model's decision with motor control, so a failed task does not say which part went wrong. HumanCLAW is built to separate the two.要判断一个视觉-语言模型能否通过物理身体行动很困难:结果同时耦合了模型的决策与运动控制,任务失败时很难分清是哪一环出了问题。HumanCLAW 正是为把这两者拆开而设计的。視覚言語モデルが身体を通じて行動できるかを評価するのは難しい。結果にはモデルの判断と運動制御の両方が絡むため、課題に失敗してもどちらが原因かを切り分けられないからだ。HumanCLAW はこの二つを分離するために設計されている。
4DecoEvo: Score-Decoupled Co-Evolution of Solver and Rubric-GeneratorDecoEvo:求解器与评分标准生成器的分数解耦协同演化DecoEvo - ソルバーとルーブリック生成器のスコア分離型共進化54 UPVOTES · JIANGWANG CHEN ET AL. · QWEN BUSINESS UNIT · ARXIV 2607.25675Text-space optimization adapts a language model by editing external natural-language artifacts rather than weights, which keeps what changed readable and lets the model stay a black box. DecoEvo evolves the solver and the rubric generator together, with their scores decoupled.文本空间优化不改权重,而是通过编辑外部的自然语言产物来适配大模型 —— 好处是改了什么始终可读,模型本身可以当作黑箱。DecoEvo 让求解器与评分标准生成器协同演化,并把两者的分数解耦。テキスト空間での最適化は、重みではなく外部の自然言語による生成物を編集してモデルを適応させる。何を変えたかが読める形で残り、モデル自体はブラックボックスのまま扱える点が利点だ。DecoEvo はソルバーとルーブリック生成器を共進化させ、両者のスコアを切り離す。
5CLBench-V: Evaluating Multimodal Context Learning from Grounding to KnowledgeCLBench-V:从视觉定位到知识层面评估多模态上下文学习CLBench-V - グラウンディングから知識までを対象としたマルチモーダル文脈学習の評価40 UPVOTES · LAI WEI ET AL. · ARXIV 2607.25294Real tasks often require a model to learn from the context it is given rather than lean only on what it absorbed in pre-training. CLBench-V evaluates that ability across multimodal settings, spanning visual grounding through to knowledge-level questions.现实任务往往要求模型从当下给定的上下文中学习,而不是只依赖预训练时吸收的知识。CLBench-V 在多模态场景下评估这项能力,覆盖从视觉定位到知识层面的问题。現実の課題では、事前学習で得た知識だけに頼るのではなく、与えられた文脈から学ぶ能力がしばしば求められる。CLBench-V はこの能力をマルチモーダルな設定で評価し、視覚的なグラウンディングから知識レベルの問いまでを対象とする。
2026-07-29 · WEDNESDAY · 12:40 PDT
1HiFi-UMI: Learning Deployable Manipulation Policies from High-Fidelity UMI Data AloneHiFi-UMI:仅用高保真 UMI 数据学习可部署的操作策略HiFi-UMI: 高忠実度の UMI データだけで実運用可能な操作方策を学習する126 UPVOTES · SIMPLE AI ET AL. · SIMPLE WORLD LAB · ARXIV 2607.25895Deployable manipulation policies are held back by data that is either accurate or scalable, rarely both: teleoperation is precise but costly, while robot-free UMI capture scales and is usually relegated to pre-training with a small real-robot anchor added later. The authors ask whether raising UMI fidelity can remove that anchor entirely.可部署的操作策略受限于数据「要么精确、要么可扩展」的困境:真机遥操作精确但扩展成本高,无机器人的 UMI 采集容易扩展,却通常只用于预训练,再补一小段真机数据做锚定。作者提出的问题是:把 UMI 数据的保真度提上去,能否彻底去掉这个锚。実運用可能な操作方策は、正確さと拡張性を兼ね備えたデータの不足に阻まれてきた。実機の遠隔操作は正確だが規模を出しにくく、ロボット不要の UMI 収集は拡張しやすい一方で主に事前学習に回され、後から少量の実機データで補正される。著者らは UMI データの忠実度を上げればその補正を不要にできるかを問う。
2A New Role for Relevance: Guiding Corpus Interaction in Agentic Search相关性的新角色:引导智能体搜索中的语料交互関連性の新たな役割: エージェント検索におけるコーパス操作を導く79 UPVOTES · JIANGNAN LI ET AL. · TENCENT · ARXIV 2607.24223Retrieval agents use relevance to pick top-k content, but the authors argue relevance alone cannot localize, compose, or verify the evidence a complex question needs. Direct Corpus Interaction supports those finer operations through grep-style exploration, yet its relevance-agnostic search surfaces useful clues late and delays convergence.检索智能体用相关性挑出 top-k 内容,但作者指出,仅靠相关性无法定位、组合与验证复杂问题所需的证据。Direct Corpus Interaction 用类似 grep 的探索支持这些更细的操作,可它的搜索不看相关性,导致有用线索出现得太晚、收敛被拖慢。検索エージェントは関連性で上位 k 件を選ぶが、著者らは関連性だけでは複雑な問いに必要な証拠を特定・構成・検証できないと論じる。Direct Corpus Interaction は grep 的な探索でそうした細かい操作を可能にするが、関連性を考慮しない探索のため有用な手がかりが遅れて現れ、収束が滞る。
3StateAct: Program State, before Pixels, for Long-Horizon Computer-Use AgentsStateAct:面向长周期计算机操作智能体,先看程序状态而非像素StateAct: 長期的なコンピュータ操作エージェントのために、ピクセルより先にプログラム状態を55 UPVOTES · YAN YANG ET AL. · SALESFORCE AI RESEARCH · ARXIV 2607.22798Computer-use agents are usually improved by sharpening perception of screenshots. The authors point out that a screenshot is a lossy rendering of the underlying program state - files, application backends, the DOM - and that different states can render to identical pixels, so they condition the agent on that state instead.计算机操作智能体通常靠强化对截图的感知来改进。作者指出,截图只是底层程序状态(文件、应用后端、DOM)的有损呈现,不同状态可能渲染出完全相同的像素,因此他们改为让智能体直接基于程序状态决策。コンピュータ操作エージェントは通常、スクリーンショットの知覚を強化して改善される。著者らは、スクリーンショットは背後のプログラム状態(ファイル、アプリのバックエンド、DOM)の劣化した描画にすぎず、異なる状態が同一のピクセルになり得ると指摘し、代わりにその状態を条件として与える。
4ReDesign: Recovering Editable Design Structures from Images via Agentic DecompositionReDesign:通过智能体分解从图像中还原可编辑的设计结构ReDesign: エージェント的分解によって画像から編集可能なデザイン構造を復元する54 UPVOTES · JOOYEOL YUN ET AL. · KAIST AI · ARXIV 2607.25565Turning a raster image back into an editable design file is a costly bottleneck, because editability depends on recovering typography, vector geometry, colors, grouping, and layer ordering together. ReDesign is an agentic framework that grows an editable layer hierarchy by selecting and composing specialized tools across those modalities.把位图还原成可编辑的设计文件是设计流程中代价高昂的瓶颈,因为可编辑性取决于同时还原字体排印、矢量几何、颜色、分组与图层顺序。ReDesign 是一个智能体框架,通过选择并组合跨模态的专用工具,逐步生长出可编辑的图层层级。ラスタ画像を編集可能なデザインファイルに戻す作業は費用のかかるボトルネックである。編集可能性はタイポグラフィ、ベクタ形状、色、グループ化、レイヤー順序をまとめて復元できるかに依存するからだ。ReDesign は各モダリティの専用ツールを選択・合成しながら編集可能なレイヤー階層を育てるエージェント的枠組みである。
5CodeNib: A Multi-View Data System for Serving Repository Context to Coding AgentsCodeNib:向编程智能体提供仓库上下文的多视图数据系统CodeNib: コーディングエージェントにリポジトリ文脈を供給するマルチビュー・データシステム34 UPVOTES · ZHONGMING YU ET AL. · SYSEVOL AI RESEARCH · ARXIV 2607.25431Coding agents keep rediscovering the same repository context because indexes, language servers, and task-local histories are disconnected. CodeNib builds lexical, dense, and structural views per commit, maps results to repository-relative source ranges, and serves ranked search, symbol navigation, and bounded context from one runtime.编程智能体反复重新发现同一份仓库上下文,原因是索引、语言服务器与任务内历史彼此割裂。CodeNib 按每次提交构建词法、稠密与结构三种视图,把结果映射回仓库相对的源码区间,并从同一个运行时提供排序检索、符号跳转与受限上下文。コーディングエージェントは、インデックス・言語サーバー・タスク内の履歴が分断されているために、同じリポジトリ文脈を何度も探し直す。CodeNib はコミットごとに字句・密ベクトル・構造の各ビューを構築し、結果をリポジトリ相対のソース範囲に対応づけ、ランク付き検索・シンボル移動・上限付き文脈を単一のランタイムから提供する。
2026-07-28 · TUESDAY · 12:40 PDT
1Kimi K3: Open Frontier IntelligenceKimi K3:开放的前沿智能Kimi K3: オープンなフロンティア知能250 UPVOTES · KIMI TEAM ET AL. · MOONSHOT AI · ARXIV 2607.24653The report introduces Kimi K3, a 2.8T parameter mixture-of-experts model with 104 billion activated parameters, native vision, and a 1-million-token context window. Alongside Kimi Delta Attention and Attention Residuals, a Stable LatentMoE design activates 16 of 896 routed experts per token, which the team credits for roughly 2.5x better scaling efficiency.报告介绍 Kimi K3:2.8 万亿参数的混合专家模型,激活参数 1040 亿,具备原生视觉能力与 100 万 token 上下文窗口。除 Kimi Delta Attention 与 Attention Residuals 外,Stable LatentMoE 让每个 token 只激活 896 个路由专家中的 16 个,团队将约 2.5 倍的扩展效率提升归功于这些设计。Kimi K3 を紹介する報告。2.8 兆パラメータの Mixture-of-Experts で、活性化パラメータは 1040 億、ネイティブな視覚能力と 100 万トークンの文脈長を持つ。Kimi Delta Attention と Attention Residuals に加え、Stable LatentMoE が 896 のルーテッドエキスパートのうち 16 をトークンごとに活性化し、これらが約 2.5 倍のスケーリング効率向上をもたらしたとする。
2JarvisHub: An Open Harness for Canvas-Native Multimodal Creative AgentsJarvisHub:面向画布原生多模态创作智能体的开放框架JarvisHub: キャンバスネイティブなマルチモーダル創作エージェントのためのオープンハーネス101 UPVOTES · YUNLONG LIN ET AL. · ARXIV 2607.23588Creative AI is moving from single-step asset generation toward long-horizon production, the authors argue. Real creative work involves references, drafts, alternatives, edits, failed attempts, version relations, tool actions, and human feedback, which together form an evolving project state that isolated prompt-output exchanges cannot hold.作者认为,创意 AI 正从单步素材生成走向长周期生产。真实创作包含参考、草稿、备选方案、修改、失败尝试、版本关系、工具操作与人类反馈,它们共同构成一份不断演进的项目状态,而孤立的提示与输出承载不了这些。著者らは、クリエイティブ AI が単発のアセット生成から長期的な制作へ移りつつあると論じる。実際の制作には参照、下書き、代替案、修正、失敗した試み、バージョンの関係、ツール操作、人間のフィードバックが含まれ、それらが進化するプロジェクト状態を形づくる。孤立したプロンプトと出力の往復では、その状態は保持できない。
4Rethinking Classifier-Free Guidance in On-Policy Diffusion Distillation重新审视 on-policy 扩散蒸馏中的无分类器引导オンポリシー拡散蒸留における classifier-free guidance の再考61 UPVOTES · BINGNAN LI ET AL. · ARXIV 2607.24731On-policy distillation adapts a diffusion model by querying a teacher along the student's own trajectories, but its behaviour under classifier-free guidance is poorly understood. The authors show that matching guided velocities directly is under-identified at the branch level, since positive- and negative-branch errors can offset each other.on-policy 蒸馏沿学生自身生成的轨迹去查询教师模型,但它在无分类器引导下的行为一直缺乏理解。作者指出,直接匹配引导后的速度在分支层面是欠定的,因为正分支与负分支的误差可以相互抵消。オンポリシー蒸留は学生自身の軌跡に沿って教師に問い合わせて拡散モデルを適応させるが、classifier-free guidance の下での挙動は十分に理解されていない。著者らは、ガイド後の速度を直接一致させる目的関数がブランチ水準では劣決定であり、正・負ブランチの誤差が互いに打ち消し合い得ることを示す。
5Progress Reward Modeling for Robotic Learning: A Comprehensive Survey机器人学习中的进度奖励建模:一份综述ロボット学習における進捗報酬モデリング: 包括的サーベイ55 UPVOTES · JIANSHU ZHANG ET AL. · NORTHWESTERN UNIVERSITY · ARXIV 2607.21655A survey of reward models that score progress rather than completion. A terminal success signal only says whether a task finished, not whether behaviour is advancing, stalling, or undoing earlier progress. The authors note the literature still lacks a shared framework, with methods differing in observations and goal specification.一篇关于「衡量进度而非完成度」的奖励模型综述。终止性成功信号只能说明任务是否完成,无法说明行为是在推进、停滞,还是在抹掉此前的进展。作者指出该领域仍缺乏统一框架,各方法在观测与目标设定上各不相同。完了ではなく進捗を評価する報酬モデルのサーベイ。終端の成功信号はタスクが終わったかしか示さず、行動が前進しているのか、停滞しているのか、以前の進捗を打ち消しているのかを語らない。著者らは、観測や目標指定が手法ごとに異なり、共通の枠組みがまだないと指摘する。
2026-07-27 · MONDAY · 00:40 PDT
1Skill Self-Play: Pushing the Frontier of LLM Capability with Co-Evolving SkillsSkill Self-Play:用协同进化的技能推进大模型能力边界Skill Self-Play: 共進化するスキルで LLM の能力限界を押し広げる16 UPVOTES · SIYUAN HUANG ET AL. · QWENBUSINESSUNIT-EDU · ARXIV 2607.22529The paper targets the dilemma in self-evolving LLM training: environment-bound methods get precise feedback but stay narrow, while open-ended self-generation broadens tasks and loses reliable verification. It proposes agent skills as the middle ground, since each skill gives deep and verifiable execution in its own domain.论文针对大模型自我进化训练中的两难:绑定环境的方法反馈精确但领域狭窄,开放式自生成任务面广却缺乏可靠验证。作者提出以 agent skills 作为折中,因为每个技能都能在自己的领域内提供可深入验证的执行过程。自己進化型 LLM 学習のジレンマを扱う。環境に紐づく手法は正確なフィードバックを得られるが領域が狭く、オープンな自己生成はタスクの幅は広がるが検証の信頼性を失う。著者はその中間解としてエージェントスキルを提案する。各スキルが自領域内で深く検証可能な実行を与えるためである。
2DataPrep-Bench: Benchmarking LLMs as Training Data PreparatorsDataPrep-Bench:评测大模型作为训练数据准备者的能力DataPrep-Bench: 学習データの準備者としての LLM を評価する14 UPVOTES · HAO LIANG ET AL. · ARXIV 2607.20465A benchmark for how well LLMs, agents, and data-centric workflows prepare training data end to end. It splits the job into data construction, which turns raw sources into supervised data, and data quality evaluation, which predicts a candidate dataset's downstream training value before training runs.一个端到端评测基准,衡量大模型、智能体与以数据为中心的流程准备训练数据的能力。它把这项工作拆成两部分:把原始素材转成监督数据的数据构建,以及在训练前预测候选数据集下游训练价值的数据质量评估。LLM、エージェント、データ中心のワークフローが学習データをどれだけ端から端まで準備できるかを測るベンチマーク。作業を、生データを教師データに変換するデータ構築と、学習前に候補データセットの下流での価値を予測するデータ品質評価の 2 つに分ける。
3Molt: A Scalable PyTorch-Native Training Framework for Agentic Reinforcement LearningMolt:面向智能体强化学习的可扩展 PyTorch 原生训练框架Molt: エージェント型強化学習のためのスケーラブルな PyTorch ネイティブ学習フレームワーク10 UPVOTES · JIAN HU ET AL. · NVIDIA · ARXIV 2607.21653NVIDIA researchers argue that agentic RL work means constant algorithm changes, and that mainstream frameworks make each change thread through trainer, distributed backend, and rollout glue. Molt keeps the codebase small enough for a researcher, or an AI coding assistant, to hold in full and trace end to end.英伟达的研究者指出,智能体强化学习的工作意味着算法不断改动,而主流框架让每次改动都要穿过训练器、分布式后端和 rollout 胶水层。Molt 把代码库压到研究者(或 AI 编程助手)能完整装进脑子、端到端追踪的规模。NVIDIA の研究者は、エージェント型 RL の研究は絶え間ない アルゴリズム変更であり、主流フレームワークではその変更がトレーナー、分散バックエンド、ロールアウトの繋ぎ込みを貫いてしまうと指摘する。Molt は研究者や AI コーディングアシスタントが全体を把握し端から端まで追える規模にコードベースを抑える。
4Scaling Native Multimodal Pre-Training From Scratch从零开始扩展原生多模态预训练ネイティブなマルチモーダル事前学習をゼロからスケールさせる7 UPVOTES · HAOYUAN WU ET AL. · TENCENT HUNYUAN · ARXIV 2607.22043Native multimodal pre-training trains from scratch on multimodal inputs, avoiding the text-only limits and late-fusion asymmetries of standard LLMs. The scaling properties of that paradigm are still uncharacterized, so this work investigates the optimal model size and token allocation for it.原生多模态预训练直接从零在多模态输入上训练,避开纯文本训练的局限与后融合架构固有的优化不对称。该范式的扩展规律此前缺乏系统刻画,本文据此研究其最优模型规模与 token 分配。ネイティブなマルチモーダル事前学習は、マルチモーダル入力でゼロから学習し、テキストのみの制約や後期融合構造の最適化の非対称性を回避する。このパラダイムのスケーリング特性は未解明であり、本研究は最適なモデル規模とトークン配分を調べる。
5LAMAR: An Open Language-Aware Multilingual Alignment RerankerLAMAR:一个开放的语言感知多语种对齐重排器LAMAR: 言語を考慮したオープンな多言語アラインメント・リランカー6 UPVOTES · SEONGTAE HONG ET AL. · NLP & AI - KOREA UNIVERSITY · ARXIV 2607.22042In multilingual RAG a retriever returns documents in several languages, which are then reranked. The authors show existing rerankers do not consistently prefer documents in the query's own language when semantically equivalent ones exist, even though document language affects the generated answer, and they release LAMAR in response.在多语种 RAG 中,检索器会返回多种语言的文档,随后交由重排器排序。作者发现,在存在语义等价文档时,现有重排器并不稳定地优先选择与查询同语种的文档,尽管文档语言会影响最终生成的答案;为此他们发布了 LAMAR。多言語 RAG では検索器が複数言語の文書を返し、その後リランクされる。著者らは、意味的に等価な文書がある場合でも既存のリランカーがクエリと同じ言語の文書を一貫して優先しないことを示す。文書の言語は生成される回答に影響するため、対応として LAMAR を公開する。