1RoboTok: An Internet-Scale Data Engine for Human Demonstration Retrieval and Dexterous Manipulation LearningRoboTok:面向人类演示检索与灵巧操作学习的互联网规模数据引擎RoboTok: 人間のデモ検索と器用な操作学習のためのインターネット規模データエンジン62 UPVOTES · HOWARD QIAN ET AL. · RICE ROBOTPI LAB · ARXIV 2609.03199RoboTok is a data engine that takes a query video of a human manipulating an object and retrieves matching demonstrations from web video at internet scale, then trains dexterous robot policies on them. It learns a latent motion space from 3D hand trajectories in actor-centered reference frames, so retrieval transfers across people and scenes. The target is the long tail of tasks robot data collection cannot cover.RoboTok 是一个数据引擎:给定一段人类操作物体的查询视频,它能在互联网规模的网络视频中检索出相关的演示片段,用于训练灵巧操作机器人策略。该方法从以操作者为中心坐标系表示的三维手部轨迹中学习潜在运动空间,使检索能够跨越不同人物与场景。其目标是覆盖机器人数据采集难以负担的长尾任务。RoboTok は、人が物体を操作するクエリ動画を与えると、インターネット規模のウェブ動画から関連するデモを検索し、器用な操作を行うロボット方策の学習に用いるデータエンジンだ。動作主中心の座標系で表した3次元手指軌跡から潜在的な運動空間を学習するため、人物や場面が変わっても検索が機能する。ロボットのデータ収集では賄いきれない長い裾野のタスクを狙う。
2Scal3R: Learning Efficient Multi-Relative Pose Query for Scalable Online 3D ReconstructionScal3R:为可扩展在线三维重建学习高效的多参考相对位姿查询Scal3R: スケーラブルなオンライン3D再構成のための効率的な多参照相対姿勢クエリの学習45 UPVOTES · CHIN-YANG LIN ET AL. · NATIONAL YANG MING CHIAO TUNG UNIVERSITY · ARXIV 2609.04201Online 3D reconstruction degrades on long videos, and the authors trace the failure to regressing every pose against a fixed first-frame anchor, which pushes the model far outside its training distribution. Per-frame depth stays intact while the global pose head collapses, so Scal3R reframes the task as querying poses relative to multiple references. The change keeps reconstruction stable over much longer sequences.在线三维重建在长视频上会明显退化,作者将失败归因于把所有位姿都相对于固定的首帧锚点回归,这会让模型远远偏离训练分布。研究发现逐帧深度依然可靠,崩溃的只是全局位姿头,因此 Scal3R 把任务重新表述为相对多个参考帧的位姿查询。这一改动让重建在更长的序列上保持稳定。オンライン3D再構成は長い動画で精度が崩れるが、著者らはその原因を、すべての姿勢を固定した先頭フレームを基準に回帰させるため学習分布から大きく外れる点に求めた。フレームごとの深度は保たれ、崩壊するのは大域的な姿勢推定部分だけであることから、Scal3R は複数の参照フレームに対する相対姿勢のクエリとして問題を定式化し直す。これにより、はるかに長い系列でも再構成が安定する。
3Editable Visual Design可编辑视觉设计編集可能なビジュアルデザイン40 UPVOTES · JUNYAN YE ET AL. · TENCENT HUNYUAN · ARXIV 2609.04034Diffusion image models produce flattened bitmaps with error-prone text and no way to edit a layer afterwards, while code-based generation gives clean layers but weak aesthetic judgment. The paper proposes a coding-agent paradigm in which a vision-language model acts as the creative brain and emits code, keeping layout control and editable layers. The 12-author work comes from Tencent Hunyuan.扩散图像模型生成的是压平的位图,文字容易出错,事后也无法按图层修改;而基于代码的生成虽然图层清晰,却缺乏整体审美判断。论文提出一种以编码智能体为核心的范式,让视觉语言模型充当创意大脑并输出代码,从而同时保留布局控制与可编辑图层。这项由 12 位作者完成的工作来自腾讯混元。拡散モデルによる画像生成は文字が崩れやすい平坦なビットマップを出力し、後からレイヤー単位で編集できない。一方、コードによる生成はレイヤーが整理される反面、全体の美的判断が弱い。本論文は、視覚言語モデルを創造の頭脳としてコードを生成させるコーディングエージェント型の枠組みを提案し、レイアウト制御と編集可能なレイヤーを両立させる。著者12名による腾訊混元(Tencent Hunyuan)の成果。
4The Missing Temporal Link: Temporal Context Routing for Script-Driven Audio-Video Generation缺失的时间链接:面向剧本驱动音视频生成的时间上下文路由欠けていた時間的リンク: 脚本駆動の音声・映像生成のための時間文脈ルーティング33 UPVOTES · YICHEN LIU ET AL. · ARXIV 2609.02367Joint audio-video generators have gotten good at lip and scene synchronization but still offer little control over when a shot cuts or a line of dialogue lands, which breaks script-driven production. The authors show that timing written into a structured prompt survives only in the text representation and never reaches the generator's temporal axis. Their temporal context routing carries it through explicitly.音视频联合生成模型在口型与画面同步上已经相当成熟,但对镜头在何时切换、台词在何时出现仍缺乏控制,这使其难以用于剧本驱动的内容创作。作者指出,结构化提示词中写明的时间信息只存在于文本表示里,从未真正传递到生成模型的时间轴上。他们提出的时间上下文路由则把这些信息显式地传导过去。音声と映像を同時に生成するモデルは同期の品質を高めてきたが、いつショットが切り替わり、いつ台詞が発せられるかの制御は依然として乏しく、脚本に沿った制作には使いにくい。著者らは、構造化プロンプトに書かれた時間指定がテキスト表現の中に留まり、生成側の時間軸まで届いていないことを示す。提案する時間文脈ルーティングは、その情報を明示的に受け渡す。
5Last Translation Benchmark最后的翻译基准ラスト翻訳ベンチマーク25 UPVOTES · VILÉM ZOUHAR ET AL. · ARXIV 2609.04173A 244-author collaboration argues that standard machine translation benchmarks are approaching saturation while automatic metrics remain unreliable, open to reward hacking and unactionable, and even gold human evaluation lacks reproducibility and scale. The paper offers a benchmark and evaluation method built to test the limits of current models and surface specific failure cases rather than emit one number.这项由 244 位作者共同完成的工作指出,主流机器翻译基准正逼近饱和,自动指标既不可靠、易被奖励攻击,也无法指导改进,而被视为金标准的人工评测同样缺乏可复现性与规模。论文提出一套基准与评测方法,目标是逼出当前模型的能力上限并暴露具体失败案例,而不是给出一个分数。244名の共同研究は、標準的な機械翻訳ベンチマークが飽和に近づく一方、自動評価指標は信頼性を欠き報酬ハッキングに弱く改善の指針にもならず、金標準とされる人手評価さえ再現性と規模に乏しいと論じる。本論文は、単一のスコアを出すのではなく、現行モデルの限界を突き、具体的な失敗事例を可視化するためのベンチマークと評価手法を示す。
2026-09-04 · FRIDAY · 13:05 PDT
1Compile by Training: Turning Natural-Language Specifications into Local Neural Functions以训练完成编译:将自然语言规范转化为本地神经函数訓練によるコンパイル: 自然言語仕様をローカルな神経関数へ230 UPVOTES · YUNTIAN DENG ET AL. · UNIVERSITY OF WATERLOO · ARXIV 2609.04199Researchers at the University of Waterloo propose compile by training, which turns a natural-language specification into a reusable neural function. Teacher models generate task-specific examples at compile time to train a small adapter for a compact interpreter, so the result runs without the teachers and can be stored, versioned and composed like ordinary software. It leads the day's papers with 230 votes.滑铁卢大学的研究者提出以训练完成编译的方法,把自然语言规范转化为可复用的神经函数。编译阶段由教师模型生成任务示例,用于训练紧凑解释器上的小型适配器,所得函数此后无需教师模型即可运行,并可像普通软件一样存储、版本管理与组合。该论文以 230 票位居当日榜首。ウォータールー大学の研究者らは、自然言語の仕様を再利用可能な神経関数に変換する「訓練によるコンパイル」を提案した。コンパイル時に教師モデルがタスク固有の例を生成し、小型インタプリタ向けのアダプタを学習させるため、完成した関数は教師なしで動作し、通常のソフトウェアと同様に保存・版管理・合成ができる。230票で当日首位となった。
2Terminal-Universe: Turning Agent Trajectories into Scalable Terminal EnvironmentsTerminal-Universe:把智能体轨迹转化为可扩展的终端环境Terminal-Universe: エージェントの軌跡をスケール可能な端末環境へ209 UPVOTES · JIE WU ET AL. · QWEN · ARXIV 2609.04148A Qwen team reconstructs executable terminal environments from the tool-execution history recorded in existing agent trajectories. The authors argue that post-training needs environments rather than trajectories, since each environment can be re-queried into many verifiable tasks and returns execution feedback, while a trajectory is a single frozen demonstration. The paper drew 209 votes.Qwen 团队从已有智能体轨迹中记录的工具执行历史,重建可运行的终端环境。作者认为后训练真正需要的是环境而非轨迹:每个环境都能被反复提问以生成大量可验证任务并给出执行反馈,而一条轨迹只是一次固定的示范。该论文获得 209 票。Qwenのチームは、既存のエージェント軌跡に残るツール実行履歴から、実行可能な端末環境を再構築した。著者らは事後学習に必要なのは軌跡ではなく環境だと論じる。環境は何度も問い直して検証可能なタスクを多数生み出し実行フィードバックを返すが、軌跡は固定された一度きりの実演にすぎないためだ。209票を集めた。
3Knowing When Not to Reuse: Conditional Experience Transfer in Autonomous LLM Post-Training知道何时不该复用:自主大模型后训练中的条件化经验迁移再利用しない判断: 自律的なLLM事後学習における条件付き経験転移139 UPVOTES · TINGYUN LI ET AL. · ARXIV 2608.26730This paper asks which past update evidence still applies once later training has changed the parent model. In autonomous post-training systems that propose updates, train candidates and select from evaluation feedback, an update's effect depends on its parent, data and training stage, so treating earlier success as context-free permission wastes compute. It collected 139 votes.该论文追问:当后续训练已改变父模型后,过去的更新证据还有多少仍然适用。在自动提出更新、训练候选并依据评测反馈择优的后训练系统中,一次更新的效果取决于其父模型、数据与训练阶段,把早先的成功视为无条件的通行证会浪费算力。该论文获得 139 票。本論文は、その後の学習で親モデルが変化した時点で、過去の更新の証拠がどこまで有効なのかを問う。更新を提案し候補を学習させ評価フィードバックで選ぶ自律的な事後学習システムでは、更新の効果は親モデル・データ・学習段階に依存するため、以前の成功を無条件の許可と見なせば計算資源を浪費する。139票を集めた。
4Random Attention: Rethinking KV Cache Eviction for Efficient Reasoning随机注意力:重新审视高效推理中的 KV 缓存淘汰ランダム・アテンション: 効率的推論のためのKVキャッシュ削減を問い直す108 UPVOTES · HENG WANG ET AL. · SALESFORCE AI RESEARCH · ARXIV 2609.03430Salesforce AI Research reports that the scoring signal behind KV cache eviction contributes almost nothing. Their Random Attention keeps the prompt and evicts uniformly at random within each attention head, computing no score at all, and across four models and six reasoning tasks it matches the strongest prior evictor. The paper drew 108 votes.Salesforce AI Research 发现,KV 缓存淘汰所依赖的打分信号几乎没有贡献。其提出的随机注意力保留提示词,在每个注意力头内均匀随机淘汰,完全不计算分数,在四个模型与六项推理任务上仍可比肩此前最强的淘汰方法。该论文获得 108 票。Salesforce AI Researchは、KVキャッシュ削減の土台となるスコア信号がほとんど寄与していないと報告した。提案手法ランダム・アテンションはプロンプトを残し、各アテンションヘッド内で一様にランダムに破棄するだけでスコアを一切計算しないが、4モデル・6種の推論タスクで従来最良の手法に並んだ。108票を集めた。
5It Takes Two to Match: Co-Evolving Generative Retriever with Reinforcement Learning匹配需要双方:用强化学习协同演进的生成式检索器マッチングは双方向: 強化学習で共進化する生成的リトリーバー69 UPVOTES · RUNPENG DAI ET AL. · APPLE · ARXIV 2609.00638Apple researchers present CoGR, which trains language models to build retrieval representations on both the query side and the item side rather than using generation only to expand queries. Retrieval is the first stage of search and advertising systems, selecting candidates for downstream ranking and auction. The paper drew 69 votes.苹果的研究者提出 CoGR,训练语言模型同时在查询侧与物品侧构建检索表示,而非仅用生成来扩写查询。检索是搜索与广告系统的第一环,负责从海量物品中筛出候选集,供下游排序与竞价使用。该论文获得 69 票。Appleの研究者らはCoGRを提案し、生成をクエリ拡張だけに使うのではなく、クエリ側とアイテム側の双方で検索表現を構築するよう言語モデルを学習させた。検索は検索広告システムの最初の段階であり、後段のランキングとオークションに渡す候補集合を選び出す。69票を集めた。
2026-09-03 · THURSDAY · 13:06 PDT
1HarnessDev: Can LLMs Create and Evolve Their Own Agent Harness?HarnessDev:大模型能否创建并演进自己的智能体框架?HarnessDev: LLMは自らのエージェント・ハーネスを構築し進化させられるか178 UPVOTES · YUHAO WU ET AL. · BYTEDANCE SEED · ARXIV 2609.01437ByteDance Seed introduces HarnessDev, a benchmark that evaluates models on building and evolving the agent harness itself rather than on task outputs. The unit of evaluation becomes runnable infrastructure, split across two stages. The premise is that changing the harness while holding weights fixed can substantially alter task performance, an ability current evaluations leave underexplored.字节跳动 Seed 团队提出 HarnessDev 基准,评测对象不是任务输出,而是模型自行构建与演进智能体框架(harness)的能力。评测单位由此变为可运行的基础设施,分为两个阶段。其前提是:在权重不变的情况下改动 harness 就能显著改变任务表现,而现有评测对这一能力探索不足。ByteDance Seed は、タスクの出力ではなくエージェント・ハーネス自体を構築・進化させる能力を測るベンチマーク HarnessDev を提案した。評価の単位は実行可能なインフラそのもので、2段階で構成される。重みを固定したままハーネスを変えるだけでタスク性能が大きく変わるという前提に立ち、既存評価が手薄な領域を突く。
2Language Models Can Control Their Own Attention语言模型可以自行控制注意力言語モデルは自らの注意を制御できる50 UPVOTES · NAMGYU HO ET AL. · KAIST AI · ARXIV 2609.02737KAIST AI proposes an intrinsic route to sparse attention: rather than pre-selecting context tokens with lightweight external proxy scores, the model itself signals which parts of the context matter. The target is the cost of global attention layers reading the full KV cache at every step, which proxy scoring still pays at O(N) per step.KAIST AI 提出一种内生的稀疏注意力思路:不再用轻量的外部代理分数预先挑选上下文 token,而是让模型自己指示哪些上下文重要。针对的是全局注意力层每生成一个 token 都要读取完整 KV 缓存的开销,而代理打分方案每步仍需 O(N) 的代价。KAIST AI は、外部の軽量な代理スコアで文脈トークンを事前選別するのではなく、モデル自身がどの部分が重要かを示す内在的なスパース注意の手法を提案する。狙いは、グローバル注意層が毎ステップKVキャッシュ全体を読む負荷であり、代理スコア方式でも1ステップあたりO(N)の計算が残る点にある。
3H3-World: Turning Language Understanding into World ControlH3-World:把语言理解转化为世界控制H3-World: 言語理解を世界制御へと変える47 UPVOTES · DANZE CHEN ET AL. · ARXIV 2609.01560H3-World turns the 33B MiniMax-H3 video generator into an interactive world model without adding dedicated action modules. Each action is represented as a structured language instruction, sharpening the generator's existing zero-shot control of character behavior and camera motion into precise, temporally grounded control.H3-World 将 330 亿参数的 MiniMax-H3 视频生成模型改造为可交互的世界模型,且无需引入专门的动作模块。方法是把每个动作表示为结构化的语言指令,从而把该模型原有的零样本角色行为与镜头运动控制,细化为精确且在时间上对齐的控制。H3-World は、330億パラメータの動画生成モデル MiniMax-H3 を、専用の行動モジュールを追加せずに対話的なワールドモデルへと転換する。各行動を構造化された言語指示として表現することで、同モデルが元から持つキャラクター挙動やカメラ運動のゼロショット制御を、時間的に整合した精密な制御へと洗練させる。
4ZimaBlue: Evolving Generalizable World Action Models through Scalable Video Pre-trainingZimaBlue:通过可扩展的视频预训练演化通用世界动作模型ZimaBlue: スケーラブルな動画事前学習による汎用ワールドアクションモデルの進化43 UPVOTES · XIONGHAO WU ET AL. · JOY FUTURE ACADEMY · ARXIV 2609.00188ZimaBlue learns generalizable world action models for robotic manipulation from egocentric video instead of action-labeled robot trajectories. It addresses a scaling gap: robust generalization needs broad physical experience, yet labeled trajectories are expensive and narrow. Action-free video supplies contact dynamics, tool use and long-horizon behavior across diverse settings.ZimaBlue 从第一人称视角视频中学习可泛化的机器人操作世界动作模型,而非依赖带动作标注的机器人轨迹。它针对的是规模化难题:稳健泛化需要广泛的物理经验,但标注轨迹成本高且多样性有限。无动作标注的视频则能提供接触动力学、工具使用与长时程行为等多场景经验。ZimaBlue は、行動ラベル付きのロボット軌跡ではなく一人称視点の動画から、汎化するロボット操作用ワールドアクションモデルを学習する。頑健な汎化には広範な身体的経験が要るが、ラベル付き軌跡は高コストで多様性に乏しいという規模の壁に取り組む。行動ラベルのない動画が、接触の力学や道具の使用、長期的な振る舞いを多様な環境から供給する。
5From Production Traffic to Post-Training: Building a Self-Hosted LLM That Covers the Corporate Request Mix从生产流量到后训练:构建覆盖企业请求分布的自托管大模型本番トラフィックから事後学習へ: 企業の要求構成を網羅する自己ホスト型LLMの構築33 UPVOTES · OLGA TSYMBOI ET AL. · T-TECH · ARXIV 2609.01572T-Tech reports consolidating traffic from more than 200 internal applications onto a single self-hosted model. Quality gaps were found through production error analysis along three axes - instruction following, function calling and internal task distribution - and tracked with offline benchmarks stratified to production traffic. The work targets the GPU fragmentation that data-residency rules create.T-Tech 介绍了如何把 200 多个内部应用的流量整合到单一自托管模型上。团队通过生产环境的错误分析,从指令遵循、函数调用与内部任务分布三个维度定位质量差距,并用按生产流量分层的离线基准进行跟踪。其目标是缓解数据驻留要求所造成的 GPU 资源碎片化。T-Tech は、200を超える社内アプリケーションのトラフィックを単一の自己ホスト型モデルへ統合した取り組みを報告する。品質の差は本番環境のエラー分析から、指示追従・関数呼び出し・社内タスク分布の3軸で特定し、本番トラフィックに層化したオフラインベンチマークで追跡した。データ所在地規制が生むGPUの分断が主な課題である。
2026-09-02 · WEDNESDAY · 01:04 PDT
1StudentSim: Training LLM-based Student SimulatorsStudentSim: 训练基于大语言模型的学生模拟器StudentSim: LLM ベースの学習者シミュレータを訓練する220 UPVOTES · KE YANG ET AL. · MICROSOFT RESEARCH · ARXIV 2609.01591Microsoft Research introduced StudentSim, a training framework for LLM-based simulators that stand in for real learners when evaluating AI tutors. It targets a gap between state-tracking models, which fit student behavior but handle explanations and corrections poorly, and LLM role-play, which follows guidance fluently without matching the imitated student's competence. It is the day's most upvoted paper.微软研究院提出 StudentSim,用于训练基于大语言模型的学生模拟器,在评估 AI 辅导系统时替代真实学习者。该工作针对两类方法之间的空白: 状态追踪模型能拟合学生行为,却难以处理讲解与纠正; 大模型角色扮演能流畅遵循指导,却无法匹配被模仿学生的真实水平。这是当日票数最高的论文。Microsoft Research は、AI チューターの評価において実在の学習者の代わりを務める、LLM ベースの学習者シミュレータを訓練する枠組み StudentSim を発表した。狙うのは既存手法の隙間だ。状態追跡モデルは行動を再現できても説明や訂正の処理が苦手で、LLM のロールプレイは指導に流暢に従う一方、模倣対象の学力水準を再現できない。本日最多の投票を集めた論文である。
2DreamX-Creator: Democratizing Native Audio-Video Generation at 2K ResolutionDreamX-Creator: 让 2K 分辨率的原生音视频生成走向普及DreamX-Creator: 2K 解像度のネイティブ音声・映像同時生成を身近に93 UPVOTES · JIASHU ZHU ET AL. · AMAP-ML · ARXIV 2608.31106AMAP-ML presented DreamX-Creator 1.0, a compact system built on a 7B generator that denoises audio and video jointly instead of adding sound in a separate stage. Conditioned on a first frame and a text prompt, the two streams run independently through the first half of the network and are coupled in the latter half by gated cross-modal attention.AMAP-ML 发布 DreamX-Creator 1.0,一套以 70 亿参数生成器为核心的紧凑系统,音频与视频联合去噪,而非在独立阶段后补声音。模型以首帧和文本提示为条件,两路数据流在网络前半段各自独立处理,后半段通过门控跨模态注意力耦合在一起。AMAP-ML は、7B の生成器を中核とするコンパクトな音声・映像同時生成システム DreamX-Creator 1.0 を発表した。音声を別段階で後付けするのではなく、両者を同時にノイズ除去する。先頭フレームとテキストプロンプトを条件とし、2 つのストリームはネットワーク前半では独立に処理され、後半でゲート付きクロスモーダル注意により結合される。
3GenFirst: Generation Before Reconstruction for Stable End-to-End Latent Generative ModelingGenFirst: 生成先于重建, 实现稳定的端到端隐空间生成建模GenFirst: 再構成より先に生成を——安定した端から端までの潜在生成モデリング60 UPVOTES · GUANGTING ZHENG ET AL. · BYTEDANCE SEED · ARXIV 2608.29335ByteDance Seed revisited end-to-end latent generative modeling, where the autoencoder and the generator are trained together rather than fitting a generator on a frozen, reconstruction-optimized latent space. Analyzing how different objectives shape that space, the authors target the latent collapse and the generation-reconstruction conflict that have made joint training unstable.字节跳动 Seed 团队重新审视端到端的隐空间生成建模: 自编码器与生成模型联合训练,而不是在冻结的、为重建而优化的隐空间上再训练生成模型。作者分析了不同训练目标如何塑造隐空间,针对导致联合训练不稳定的隐空间坍缩与生成-重建冲突提出解法。ByteDance Seed は、端から端までの潜在生成モデリングを再検討した。再構成向けに最適化して凍結した潜在空間の上で生成モデルを学習するのではなく、オートエンコーダと生成器を同時に訓練する枠組みだ。著者らは各目的関数が潜在空間をどう形作るかを分析し、同時学習を不安定にしてきた潜在崩壊と生成・再構成の対立に取り組む。
4Qwen-Drive-1.0: An Initial Step towards a Vision-Language Foundation Model for Autonomous DrivingQwen-Drive-1.0: 迈向自动驾驶视觉语言基础模型的第一步Qwen-Drive-1.0: 自動運転向け視覚言語基盤モデルへの第一歩56 UPVOTES · XIN ZHOU ET AL. · QWEN · ARXIV 2609.00111Qwen released Qwen-Drive-1.0, a vision-language foundation model for autonomous driving that keeps the pretrained VLM architecture and folds 3D perception, visual question answering and motion planning into one framework. An external bird's-eye-view head performs 3D detection, occupancy prediction and map segmentation, probing what 3D structure the shared representations expose.Qwen 发布 Qwen-Drive-1.0,一个面向自动驾驶的视觉语言基础模型,保留预训练视觉语言模型的架构,并将三维感知、视觉问答与运动规划整合进统一框架。外接的鸟瞰图头部负责三维目标检测、语义占据预测与地图分割,用以探查共享表征中究竟包含多少三维结构信息。Qwen は、自動運転向けの視覚言語基盤モデル Qwen-Drive-1.0 を公開した。事前学習済み VLM のアーキテクチャを保ちつつ、3D 認識・視覚質問応答・動作計画を単一の枠組みに統合する。外付けの鳥瞰図ヘッドが 3D 物体検出、占有予測、地図セグメンテーションを担い、共有表現からどの程度の 3D 構造が取り出せるかを探る役割も果たす。
5SMELT: Scaling Laws for Compute-Matched MoE Looped TransformersSMELT: 算力对齐条件下 MoE 循环 Transformer 的扩展律SMELT: 計算量を揃えた MoE ループ型 Transformer のスケーリング則53 UPVOTES · SHAOWEN WANG ET AL. · BYTEDANCE SEED · ARXIV 2609.01343ByteDance Seed measured looped Transformers under matched compute, holding per-token FLOPs, non-embedding parameters and KV cache constant so that extra depth is not confused with extra FLOPs. The resulting SMELT recipe loops the middle half of a sparse mixture-of-experts model's layers twice, and is scaled across four sizes up to 54B non-embedding parameters.字节跳动 Seed 团队在算力对齐的条件下评估循环 Transformer: 固定每 token 的 FLOPs、非嵌入参数量与 KV 缓存,避免把额外深度带来的收益与额外算力混为一谈。由此得到的 SMELT 方案将稀疏专家混合模型中间一半的层循环两次,并在最高 540 亿非嵌入参数的四个规模上验证。ByteDance Seed は、計算量を揃えた条件でループ型 Transformer を評価した。トークンあたりの FLOPs、非埋め込みパラメータ数、KV キャッシュを一致させ、深さの増加による効果と計算量の増加を混同しないようにしている。得られた SMELT のレシピは、疎な MoE モデルの中間半分の層を 2 回ループさせるもので、非埋め込み 540 億パラメータまでの 4 規模で検証された。
2026-09-01 · TUESDAY · 13:05 PDT
1Does On-Policy Distillation Really Distill? From Noisy Teacher to Self-Improvement同策略蒸馏真的在蒸馏吗?从含噪教师到自我提升オンポリシー蒸留は本当に蒸留しているのか: ノイズを含む教師から自己改善へ90 UPVOTES · YI DING ET AL. · PURDUE UNIVERSITY · ARXIV 2608.31046Purdue researchers measured the supervision a teacher supplies during on-policy distillation, where the teacher scores trajectories that are off-policy for it, and found substantial noise that becomes more prevalent as the teacher grows larger. The student policy converges regardless, which the authors read as pointing to self-improvement rather than transfer from the teacher.普渡大学的研究者量化了同策略蒸馏中教师提供的监督信号:教师需要给对它而言属于离策略的学生轨迹打分,结果发现其中噪声显著,且教师规模越大噪声越普遍。学生策略却对这种噪声并不敏感、照常收敛,作者据此认为提升更多来自自我改进而非来自教师的知识迁移。パデュー大学の研究者らは、オンポリシー蒸留において教師が与える監督信号を定量的に分析した。教師は自身にとってはオフポリシーである生徒の軌跡を採点するため、その信号には無視できないノイズが含まれ、教師の規模が大きいほど頻度が増す。それでも生徒の方策は収束しており、著者らは性能向上の源が教師からの転移ではなく自己改善にあると読み解いている。
2Lucida: Parse, Generate, and Place for Composable Real-to-Sim Scene ModelingLucida:面向可组合真实到仿真场景建模的解析、生成与摆放Lucida: 構成可能な実世界からシミュレーションへのシーンモデリングのための解析・生成・配置65 UPVOTES · MINGHAN QIN ET AL. · BYTEDANCE SEED · ARXIV 2608.30821ByteDance Seed presents Lucida, a pipeline that turns a capture of a real indoor room into complete, individually editable object assets arranged as they were observed. It targets the weak point of existing parse-generate-place systems, each stage of which assumes accurate instance geometry, unoccluded views and assets that match the scene. The output is aimed at robot simulation and embodied AI.字节跳动 Seed 团队提出 Lucida,可将真实室内场景的采集数据还原为完整且可单独编辑的物体资产,并按原有布局摆放。该工作针对现有「解析-生成-摆放」流程的薄弱环节:每一步都预设了准确的实例几何、无遮挡视角以及与场景吻合的资产,而杂乱的实拍很难满足。成果面向机器人仿真与具身智能。ByteDance Seed は、実際の室内空間の撮影データを、観測どおりに配置された編集可能な個別オブジェクト資産へと復元するパイプライン Lucida を提案した。既存の「解析・生成・配置」型手法は各段階で正確なインスタンス形状、遮蔽のない視点、シーンに合致した資産を前提とするが、雑然とした実撮影ではそれが成り立たない点を突く。出力はロボットのシミュレーションや身体性 AI での利用を想定する。
3J-Zero: Unified Challenger--Solver--Judge Co-Evolution from Zero DataJ-Zero:从零数据出发的出题者-解题者-评判者统一协同进化J-Zero: ゼロデータから始める出題者・解答者・審判の統合的共進化37 UPVOTES · GYOUK CHU ET AL. · KAIST AI · ARXIV 2608.26582KAIST AI trains a challenger, a solver and a judge together from no seed data, so a model can keep improving in domains where an answer cannot be checked automatically. The challenger raises task difficulty as the solver adapts to it, while the judge co-adapts alongside them to supply the reward signal that unverifiable tasks lack.KAIST AI 让出题者、解题者与评判者在零起始数据的条件下共同训练,使模型也能在答案无法自动校验的领域持续提升。出题者不断加大任务难度、解题者随之调整,评判者则与二者协同演化,为这类不可验证任务补上缺失的奖励信号。KAIST AI は、出題者・解答者・審判を初期データなしで同時に学習させ、答えを自動検証できない領域でもモデルが改善し続けられるようにした。出題者が課題の難度を上げ、解答者がそれに適応する一方、審判も両者と並んで共進化し、検証不能な課題に欠けている報酬信号を供給する。
4Normalized Low-Rank Adaptation归一化低秩适配正規化された低ランク適応37 UPVOTES · JIALE KANG ET AL. · ARXIV 2608.31036NoRA normalizes the down-projection matrices during LoRA training, on the observation that a zero-initialized up-projection leaves early optimization almost entirely to the down-projection. The authors report that applying the same normalization only at initialization already improves standard LoRA, making it a drop-in change to a widely used fine-tuning method.NoRA 在 LoRA 训练过程中对下投影矩阵做归一化,其依据是:上投影初始化为零,因此早期优化动态几乎完全由下投影主导。作者称,即便只在初始化阶段施加同样的归一化,也能改善标准 LoRA,相当于为这一常用微调方法提供了可直接替换的改动。NoRA は、LoRA の学習中にダウン射影行列を正規化する手法である。アップ射影がゼロで初期化されるため、初期の最適化はほぼダウン射影に委ねられるという観察に基づく。著者らは、同じ正規化を初期化時にのみ適用しても標準的な LoRA が改善すると報告しており、広く使われる微調整手法にそのまま差し込める変更となる。
5StarHarness: Evolving Harnesses with Stratified Search for Enterprise EnvironmentsStarHarness:以分层搜索为企业环境演化智能体框架StarHarness: 層化探索によるエンタープライズ環境向けハーネスの進化35 UPVOTES · ESAKKIVEL ESAKKIRAJA ET AL. · SERVICENOW-AI · ARXIV 2608.24804ServiceNow's StarHarness evolves the scaffolding around an agent, including task framing, tool interfaces, skills, MCP-backed providers, subagent structure and agent-loop configuration, while model weights stay fixed. It stratifies tasks by baseline failure behavior and separates proposer-visible tasks from those held back for selection and evaluation, tested on IT operations and finance benchmarks.ServiceNow 的 StarHarness 在模型权重保持不变的前提下,演化智能体外围的框架,涵盖提示与任务表述、工具接口、技能、由 MCP 提供的服务、子智能体结构以及智能体循环配置。它按基线失败情况对任务分层,并把提议者可见的搜索任务与用于筛选和留出评测的任务分开,在 IT 运维与金融基准上进行了验证。ServiceNow の StarHarness は、モデルの重みを固定したまま、エージェントを取り巻く足場、すなわちプロンプトや課題の提示、ツールのインタフェース、スキル、MCP 経由のプロバイダ、サブエージェント構成、エージェントループの設定を進化させる。課題をベースラインでの失敗の仕方で層化し、提案側から見える探索用の課題と、選択および評価用に取り置く課題を分離したうえで、IT 運用や金融のベンチマークで検証している。
2026-08-31 · MONDAY · 13:06 PDT
1LoopArena: Benchmarking Models as Runtime Controllers for Loop EngineeringLoopArena:将模型作为循环工程运行时控制器的基准测试LoopArena: ループエンジニアリングの実行時コントローラーとしてのモデルを評価する82 UPVOTES · YI WANG ET AL. · AMAP-ML · ARXIV 2608.28281A seven-author team at AMAP-ML introduces LoopArena, a benchmark that scores a model as the runtime controller of a coding-agent loop rather than as the coder. The authors note that the outcome of one end-to-end run cannot separate the loop's guidance from the agent's own ability, so the benchmark isolates decisions such as when to verify, where to spend budget and when to stop.AMAP-ML 的七人团队提出 LoopArena,这一基准考察模型作为编码智能体循环的运行时控制器,而非作为写代码的一方。作者指出,单次端到端运行的结果无法区分成败源于循环的调度还是智能体自身能力,因此基准把何时验证、预算投向何处、何时停止等决策单独拆出评估。AMAP-ML の 7 名のチームは、コーディングエージェントのループを制御する実行時コントローラーとしてモデルを採点するベンチマーク LoopArena を提案した。著者らは、1 回のエンドツーエンド実行の結果ではループの誘導とエージェント自身の能力を切り分けられないと指摘し、いつ検証するか、予算をどこに使うか、いつ停止するかといった判断を切り出して評価する。
2DART-SD: Diamond-topology Aware Retrieval and Tuning for Self-Distillation of Multi-Turn Tool-Calling AgentsDART-SD:面向多轮工具调用智能体自蒸馏的菱形拓扑感知检索与调优DART-SD: 多ターンのツール呼び出しエージェントの自己蒸留に向けたダイヤモンド構造を考慮した検索とチューニング60 UPVOTES · HANGRUI XU ET AL. · BYTEDANCE · ARXIV 2608.18524ByteDance researchers propose DART-SD, a self-distillation recipe for multi-turn tool-calling agents. They argue that imitating full-length trajectories collapses the combinatorial lattice formed by order-independent sub-goals, indiscriminately penalizing valid alternative orderings and degrading policy diversity. DART-SD instead pairs topology-aware retrieval with tuning to keep that structure.字节跳动的研究者提出 DART-SD,一种面向多轮工具调用智能体的自蒸馏方法。他们认为,模仿完整长度的轨迹会压垮由次序无关子目标构成的组合格结构,对同样有效的其他执行顺序一并施加惩罚,从而削弱策略多样性。DART-SD 转而以拓扑感知的检索配合微调来保留这一结构。バイトダンスの研究者らは、多ターンのツール呼び出しエージェント向けの自己蒸留手法 DART-SD を提案した。全長の軌跡をそのまま模倣すると、順序に依存しないサブゴールが作る組合せ格子が潰れ、妥当な別順序まで一律に罰せられて方策の多様性が損なわれると論じる。DART-SD は構造を考慮した検索とチューニングを組み合わせてこれを保つ。
3Puro-2B: Poor Lab's Qwen2-1.5B Trained on RTX 5090 within $5090Puro-2B:小实验室在 RTX 5090 上以 5090 美元训练的 Qwen2-1.5BPuro-2B: 小規模ラボが RTX 5090 上で 5090 ドル以内に学習した Qwen2-1.5B26 UPVOTES · KAIRONG LUO ET AL. · PACMAN GROUP, TSINGHUA UNIVERSITY · ARXIV 2608.27370An 11-author team from Tsinghua University's PACMAN Group publishes an open pretraining recipe and the Puro-2B models it produces, trained on an RTX 5090 for under 5,090 dollars. The report notes that training Llama-3.2-3B costs over 1.5 million dollars and reproducing SmolLM3-3B over 700,000, and argues a cost-efficient, hardware-accessible recipe has been the missing piece for academic and open-source groups.清华大学 PACMAN 组的十一人团队公开了一套预训练配方以及由此训练出的 Puro-2B 系列模型,全部在一块 RTX 5090 上完成,成本低于 5090 美元。报告指出,训练 Llama-3.2-3B 需超过 150 万美元,复现 SmolLM3-3B 也要 70 万美元以上,而学术界与开源社区一直缺少一份低成本、硬件可及的配方。清華大学 PACMAN グループの 11 名のチームが、オープンな事前学習レシピと、それにより RTX 5090 上で 5,090 ドル未満で学習した Puro-2B 群を公開した。報告は Llama-3.2-3B の学習に 150 万ドル超、SmolLM3-3B の再現に 70 万ドル超がかかると指摘し、低コストで入手しやすいハードウェア向けのレシピが学術・オープンソース側に欠けていたと論じる。
4Act with Intent: Distilling Behavior Intent for Vision-Language-Action Models意图先行:为视觉-语言-动作模型蒸馏行为意图意図を持って行動する:視覚・言語・行動モデルのための行動意図の蒸留24 UPVOTES · SANGOH LEE ET AL. · POHANG UNIVERSITY OF SCIENCE AND TECHNOLOGY · ARXIV 2608.23478Three researchers at POSTECH propose Intention Distillation for vision-language-action models, whose action decoders are still trained largely by behavior cloning. That supervision records which motor command was demonstrated but leaves the local objective implicit, and the authors argue future-based signals such as frames or trajectories capture particular realizations rather than the shared aim of the behavior.韩国浦项科技大学的三位研究者为视觉-语言-动作模型提出意图蒸馏,此类模型的动作解码器目前仍主要依靠行为克隆训练。这种监督只记录示范中执行了哪条运动指令,而把该行为在指令下所服务的局部目标留作隐含;作者认为基于未来帧或轨迹的信号捕捉的是某一次具体实现,而非行为共有的语义目标。韓国・浦項工科大学の 3 名の研究者は、視覚・言語・行動モデル向けに意図蒸留を提案した。これらのモデルの行動デコーダーは今なお主に行動クローニングで学習され、どの運動指令が示範されたかは教えても、その行動が指示のもとで果たす局所的な目的は暗黙のままである。将来のフレームや軌跡に基づく信号は個別の実現例を捉えるにすぎないと著者らは論じる。
5LayerRecall: A State-Conditioned Memory Router for Long-Horizon Consistency in Video GenerationLayerRecall:面向视频生成长时程一致性的状态条件记忆路由器LayerRecall: 動画生成の長期的一貫性のための状態条件付きメモリルーター24 UPVOTES · YIXUAN DING ET AL. · ZHEJIANG UNIVERSITY · ARXIV 2608.28460A Zhejiang University team introduces LayerRecall, a memory router for autoregressive video diffusion, which generates long clips chunk by chunk from a bounded recent context and evicts the historical cues needed when a subject or scene reappears. Their analysis finds video DiT layers differ in their preference for current, recent and distant context, so the router decides both what to retrieve and where to use it.浙江大学团队提出 LayerRecall,一个用于自回归视频扩散的记忆路由器。此类模型以有限的近期上下文逐块生成长视频,会丢弃主体或场景再次出现时所需的历史线索。团队的分析发现,视频 DiT 的不同层对当前、近期与久远上下文的偏好各异,因此路由器同时决定检索什么以及在哪一层使用。浙江大学のチームは、自己回帰的な動画拡散のためのメモリルーター LayerRecall を提案した。この方式は限られた直近の文脈からチャンク単位で長尺動画を生成するため、被写体や場面が再登場する際に必要な過去の手がかりを捨ててしまう。解析の結果、動画 DiT の層ごとに現在・近傍・遠方の文脈への選好が異なると分かり、ルーターは何を取り出すかとどこで使うかを併せて決める。
2026-08-29 · SATURDAY · 13:04 PDT
1Zero-WAM: In-Context World-Action Modeling from Human Videos for Open-Ended Task GeneralizationZero-WAM:基于人类视频的上下文世界-动作建模,实现开放式任务泛化Zero-WAM: 人間の動画からの文脈内ワールド・アクションモデリングによるオープンエンドなタスク汎化17 UPVOTES · JIAMING ZHOU ET AL. · ROBBYANT RESEARCH · ARXIV 2608.26103Zero-WAM carries in-context learning over from language models to robot manipulation, using a human video rather than a sentence as the specification of a new task. The authors argue video is the natural specification for manipulation because it supplies visual cues that language leaves out. The policy then executes tasks never seen in training without any parameter update.Zero-WAM 把大语言模型中的上下文学习迁移到机器人操作上,用一段人类视频而非一句指令来指定新任务。作者认为视频才是操作任务的天然表述方式,因为它提供了语言无法承载的视觉线索。策略据此执行训练中从未见过的任务,且无需更新任何参数。Zero-WAM は、大規模言語モデルの文脈内学習をロボット操作に持ち込み、新しいタスクの指定に文ではなく人間の動画を用いる。著者らは、言語が取りこぼす視覚的手がかりを与える動画こそ操作タスクの自然な指定手段だと論じる。方策はこれをもとに、学習時に一度も見ていないタスクをパラメータ更新なしで実行する。
2WikiSkill: Compiling Agent Experience into Persistent Knowledge for Skill EvolutionWikiSkill:将智能体经验编译为持久知识以驱动技能演化WikiSkill: エージェントの経験を永続的な知識へ編纂しスキルを進化させる11 UPVOTES · LIYAN TANG ET AL. · GOOGLE · ARXIV 2608.27454Google proposes WikiSkill, a framework that evolves an agent's skill library alongside a persistent knowledge base rather than in isolation. It targets a specific gap in automatic skill discovery: the insights that guide how a skill develops stay scattered through optimization histories and are rarely reused across iterations. WikiSkill keeps raw execution experience and accumulated knowledge in separate layers.谷歌提出 WikiSkill,让智能体的技能库不再孤立演化,而是与一个持久化的知识库(wiki)协同演进。该工作针对自动技能发现中的一处具体缺口:指导技能形成的经验判断散落在优化历史中,难以在多轮迭代间系统复用。WikiSkill 将原始执行经验与沉淀下来的知识分层存放。Google は、エージェントのスキル群を単独で更新するのではなく、永続的な知識ベース(wiki)と共進化させるフレームワーク WikiSkill を提案した。自動的なスキル発見における具体的な欠落、すなわちスキルの育て方を導く知見が最適化履歴の中に散在し、反復をまたいで再利用されにくい点を狙う。WikiSkill は生の実行経験と蓄積された知識を層として分離する。
3Procedura: Agentic 3D Modeling with Procedural ControlProcedura:具备程序化控制的智能体三维建模Procedura: 手続き的な制御によるエージェント型 3D モデリング10 UPVOTES · YOUTIAN LIN ET AL. · NANJING UNIVERSITY · ARXIV 2608.26238Procedura treats a 3D shape as code, scaling an LLM's coding ability to write an object as a procedural assembly whose named parts are joined by typed, machine-checkable mates. The team from Nanjing University aims at three weaknesses of dense meshes from native 3D generators: soft edges where an object should be sharp, no part decomposition, and no parameter a user can edit.Procedura 把三维形状当作代码来生成,借助并放大大语言模型的编程能力,将物体写成一段程序化装配:各具名部件之间以带类型、可机器校验的配合关系相连。南京大学团队针对原生三维生成器输出稠密网格的三处短板:本该锐利的边缘变得圆钝、缺乏部件分解、以及不提供任何可供用户修改的参数。Procedura は 3D 形状をコードとして扱い、大規模言語モデルのコーディング能力を活かして、名前付きの部品どうしを型付きで機械検証可能な結合関係でつないだ手続き的アセンブリとして物体を記述する。南京大学のチームが狙うのは、ネイティブ 3D 生成器が出す密なメッシュの三つの弱点、すなわち鋭くあるべき箇所の甘さ、部品分解の欠如、そして編集できるパラメータが一切ないことである。
4CritICL: Inference-Time Weak-to-Strong Generalization from Small Language Model Failure ModesCritICL:从小语言模型的失败模式出发,实现推理时的由弱到强泛化CritICL: 小規模言語モデルの失敗モードを用いた推論時のウィーク・トゥ・ストロング汎化8 UPVOTES · YUFAN WU ET AL. · ARXIV 2608.27455CritICL improves reasoning at inference time without the repeated generation or external verification that inference-time scaling usually requires. Its premise is that failure modes are structured and recur across model scales within one family, so the mistakes of a small model become guidance for a larger one. The authors present failures as a source of signal rather than output to discard.CritICL 在推理阶段提升模型的推理能力,却不依赖推理时扩展通常需要的反复采样或外部验证器。其核心假设是:失败模式具有结构性,且在同一模型家族的不同规模之间反复出现,因此小模型犯的错可以转化为对大模型的指引。作者把失败视为可用的信号来源,而非应当丢弃的劣质输出。CritICL は、推論時スケーリングが通常必要とする繰り返し生成や外部検証を用いずに、推論時点で推論性能を高める。前提となるのは、失敗の仕方には構造があり、同じモデルファミリー内では規模をまたいで繰り返し現れるという観察であり、小さなモデルの誤りがより大きなモデルへの手がかりになる。著者らは失敗を捨てるべき出力ではなく信号源として位置づける。
5Magpie: Real-Time World Renderer for Interactive GamesMagpie:面向交互式游戏的实时世界渲染器Magpie: インタラクティブゲームのためのリアルタイム世界レンダラー7 UPVOTES · XIAOYU ZHAN ET AL. · ARXIV 2608.27168Magpie is a real-time generative world renderer built for games rather than linear media. The authors note that video foundation models now reshape film and video work, but a game additionally needs stable, reproducible rules, object states and interaction outcomes on top of continuous imagery. The target is the cost of asset production, which stretches prototype development cycles.Magpie 是一个面向游戏而非线性影像的实时生成式世界渲染器。作者指出,视频基础模型正在改变影视与视频制作,但游戏除了连续可信的画面之外,还需要稳定且可复现的规则、物体状态与交互结果。该工作瞄准的是资产制作的高昂成本,这一成本正拉长原型开发周期。Magpie は、線形メディアではなくゲームに向けて作られたリアルタイム生成世界レンダラーである。著者らは、動画基盤モデルが映像制作を変えつつある一方で、ゲームには連続した映像に加えて、安定して再現可能なルール、物体の状態、相互作用の結果が必要だと指摘する。狙いは、プロトタイプの開発期間を引き延ばしているアセット制作コストである。