AI Papers — Daily Top 5
2026-07-17 · FRIDAY
- 1 VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video UnderstandingVideoChat3:面向高效通用视频理解的完全开放视频多模态大模型VideoChat3:効率的で汎用的な動画理解のための完全オープン動画MLLM A fully open video multimodal LLM covering motion, long-video and streaming understanding, positioned as an open reference stack for video assistants. 完全开放的视频多模态大模型,覆盖动作理解、长视频与流式交互,定位为视频助手的开放参考实现。 動作理解・長尺動画・ストリーミング対話をカバーする完全オープンな動画マルチモーダルLLM。ビデオアシスタントのオープンな参照実装を目指す。
- 2 LongStraw: Long-Context RL Beyond 2M Tokens under a Fixed GPU BudgetLongStraw:固定 GPU 预算下超 200 万 token 的长上下文强化学习LongStraw:固定GPU予算で200万トークン超の長文脈RL Reinforcement-learning post-training beyond 2 million tokens of context under a fixed GPU budget, attacking the widening gap between inference context lengths and what RL training can reach. 在固定 GPU 预算下把强化学习后训练扩展到 200 万 token 以上的上下文,直面推理上下文长度与 RL 训练能力之间日益扩大的差距。 固定GPU予算のもとで強化学習ポストトレーニングを200万トークン超のコンテキストへ拡張。推論時コンテキスト長とRL訓練の間で広がるギャップに挑む。
- 3 SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement LearningSEED:面向智能体强化学习的自进化在线蒸馏SEED:エージェント強化学習のための自己進化型オンポリシー蒸留 Self-evolving on-policy distillation for agentic RL: models trained as interactive agents on long-horizon tasks learn from their own improving policy instead of a fixed teacher. 面向智能体强化学习的自进化在线蒸馏:在长程任务中作为交互式智能体训练的模型,从自身不断改进的策略中学习,而不是依赖固定的教师模型。 エージェント強化学習のための自己進化型オンポリシー蒸留。長期タスクで対話型エージェントとして訓練されたモデルが、固定の教師ではなく自らの改善する方策から学ぶ。
- 4 SearchOS-V1: Towards Robust Open-Domain Information-Seeking Agent CollaborationSearchOS-V1:迈向稳健的开放域信息检索SearchOS-V1:頑健なオープンドメイン情報探索へ Works toward robust open-domain information seeking with tool-integrated LLMs, treating web search as a core model capability rather than a bolted-on tool. 研究让工具集成的大模型具备稳健的开放域信息检索能力,把网页搜索当作模型的核心能力而不是外挂工具。 ツール統合LLMによる頑健なオープンドメイン情報探索を目指す研究。ウェブ検索を後付けのツールではなくモデルの中核能力として扱う。
- 5 BadWAM: When World-Action Models Dream Right but Act WrongBadWAM:当世界-行动模型梦得对却做得错BadWAM:世界行動モデルが正しく夢を見て誤って動くとき Examines world-action models that predict the future correctly yet still act wrongly - an embodied-control failure mode where dreaming right does not mean acting right. 研究“世界-行动模型”预测未来正确却行动错误的现象——一种具身控制的失效模式:梦得对不代表做得对。 世界行動モデル(WAM)が未来を正しく予測しながら誤った行動を取る現象を分析。「正しく夢を見ても正しく動ける」とは限らないという身体性制御の失敗モードを示す。