1NVIDIA-labs OO Agents: Native Python Object-Oriented AgentsNVIDIA OO Agents:以原生 Python 对象构建智能体NVIDIA OO Agents: ネイティブ Python のオブジェクト指向エージェント19 UPVOTES · PAUL FURGALE ET AL. · NVIDIA · ARXIV 2607.20709Nvidia proposes NOOA, a framework in which an agent is simply a Python object: methods are its actions, fields its state, docstrings its prompts and type annotations its contracts. A method whose body is only an ellipsis gets completed at runtime by an LLM loop, while normal method bodies stay deterministic Python. The aim is to collapse prompt templates, tool schemas and workflow graphs into one artifact.英伟达提出 NOOA 框架:一个智能体就是一个 Python 对象,方法即动作,字段即状态,文档字符串即提示词,类型标注即契约。方法体若只写省略号,就在运行时交由大模型循环补全;写了正常实现的方法则仍是确定性的 Python 代码。其目标是把提示模板、工具 schema 和工作流图收拢成同一份产物。エヌビディアは、エージェントを単なる Python オブジェクトとして表現するフレームワーク NOOA を提案した。メソッドが行動、フィールドが状態、docstring がプロンプト、型注釈が契約にあたる。本体が省略記号だけのメソッドは実行時に LLM ループが補完し、通常の実装を持つメソッドは決定的な Python のまま残る。プロンプトテンプレートやツールスキーマ、ワークフローグラフを一つの成果物にまとめることを狙う。
2Tencent WorkBuddy Bench: A Multi-Domain Coding-Agent Benchmark with Contamination-Resistant Task Construction腾讯 WorkBuddy Bench:抗污染任务构造的多领域编码智能体基准Tencent WorkBuddy Bench: 汚染耐性のあるタスク構成による多領域コーディングエージェント評価19 UPVOTES · TENCENT WORKBUDDY BENCH TEAM ET AL. · TENCENT · ARXIV 2607.20911Tencent released an evaluation suite for coding agents spanning four work domains: code, web, office and security. Rather than reusing public issue text, each task is reverse-engineered from a real commit, pull request or business scenario and rewritten as a short colloquial request, so the prompt cannot be recovered from training data. The report also gives a cross-model leaderboard.腾讯发布面向编码智能体的评测套件,覆盖代码、Web、办公与安全四个工作领域。任务并非取自公开的 issue 文本,而是从真实的提交、合并请求或业务场景反向构造,再改写成简短口语化的请求,使提示词无法从训练数据中还原。报告同时给出了构建方法、评分协议和跨模型排行榜。テンセントは、コード・Web・オフィス・セキュリティの 4 領域にまたがるコーディングエージェント評価スイートを公開した。公開 issue の文面を流用せず、実際のコミットやプルリクエスト、業務シナリオから逆算してタスクを構成し、短い口語調の依頼文に書き換えることで、プロンプトが学習データから復元できないようにしている。報告書には構築手法、採点プロトコル、モデル横断のリーダーボードがまとめられている。
3Color Pass-Through via Camera-Display Coupling相机与显示耦合的色彩直通カメラとディスプレイの結合による色のパススルー18 UPVOTES · RUIKANG LI ET AL. · MMLAB-CUHK · ARXIV 2607.12746A scene shot on a phone and shown on the same phone's screen still looks noticeably off in color, brightness and contrast. The authors trace the gap to pipelines that calibrate the camera and the display separately and then bridge them with low-dimensional color transforms, which creates information bottlenecks and compounding error. They propose treating capture and display as one coupled system instead.同一部手机拍下的画面,在自己的屏幕上显示时,色彩、亮度和对比度往往与实景明显不同。作者指出问题出在现有流程:相机与显示分别标定,再用低维色彩变换连接,由此产生信息瓶颈和误差累积。他们主张把拍摄与显示当作一个耦合系统统一处理。同じスマートフォンで撮影した情景を自機の画面で見ると、色や明るさ、コントラストが実景と目に見えて食い違う。著者らは、カメラとディスプレイを別々に校正し、低次元の色変換でつなぐ既存パイプラインが情報のボトルネックと誤差の累積を生んでいると指摘する。そこで撮影と表示を一つの結合系として扱う手法を提案している。
4SANA-Video 2.0: Hybrid Linear Attention with Attention Residuals for Efficient Video GenerationSANA-Video 2.0:用带注意力残差的混合线性注意力实现高效视频生成SANA-Video 2.0: 注意残差を備えたハイブリッド線形注意による効率的な動画生成18 UPVOTES · JUNSONG CHEN ET AL. · NVIDIA · ARXIV 2607.21553SANA-Video 2.0 is a hybrid video diffusion transformer at 5B and 14B scale that generates up to 720p video on a single GPU. It mixes gated linear attention for the bulk of token mixing with periodic gated-softmax anchors at a 3:1 ratio, restoring the full-rank token interactions pure linear attention loses. The claim is full-softmax quality with linear attention's long-sequence scaling.SANA-Video 2.0 是一个混合式视频扩散 Transformer,提供 5B 与 14B 两种规模,可在单张 GPU 上生成最高 720p 的视频。它以门控线性注意力承担大部分 token 混合,并按 3:1 的比例周期性插入门控 softmax 锚点,补回纯线性注意力所缺失的满秩 token 交互。作者称其画质可比肩全 softmax 模型,同时保留线性注意力在长序列上的扩展优势。SANA-Video 2.0 は 5B と 14B の規模を持つハイブリッド動画拡散トランスフォーマーで、単一 GPU で最大 720p の動画を生成する。トークン混合の大半をゲート付き線形注意が担い、3:1 の比率でゲート付き softmax のアンカーを周期的に挟むことで、純粋な線形注意では失われる全ランクのトークン相互作用を回復させる。フル softmax 並みの品質と、線形注意の長系列スケーリングの両立を主張している。
5LLMs Get Lost in Evolving User Intent用户意图不断变化时,大模型会迷失方向LLM は移り変わるユーザーの意図を見失う17 UPVOTES · JIHOON TACK ET AL. · MICROSOFT RESEARCH · ARXIV 2607.20734Real users rarely state what they want upfront; they disclose, revise and reshape it as a conversation unfolds. Yet models are still mostly evaluated and trained on single-turn, fully-specified prompts. Microsoft Research introduces a framework that turns fully-specified tasks into evolving ones to test how well models track intent that keeps moving.真实用户很少一开始就把需求说清楚,而是在对话过程中逐步透露、修改乃至重塑意图。但当前模型的评测与训练,仍以单轮、需求完整给定的提示为主。微软研究院提出一套框架,把完整给定的任务改造成随对话演化的任务,用以检验模型能否跟上不断变化的用户意图。現実のユーザーは最初に要件を言い切ることはまれで、会話の中で少しずつ明かし、修正し、作り変えていく。それにもかかわらずモデルの評価と学習は、いまなお単一ターンで要件が完全に指定されたプロンプトが中心である。マイクロソフトリサーチは、完全指定のタスクを変化するタスクへ変換する枠組みを導入し、動き続ける意図をモデルがどこまで追えるかを検証した。
2026-07-24 · FRIDAY · 15:44 PDT
1AREX: Towards a Recursively Self-Improving Agent for Deep ResearchAREX:面向深度研究的递归自我改进 agentAREX:ディープリサーチのための再帰的自己改善エージェント115 UPVOTES · SHUQI LU ET AL. · BEIJING ACADEMY OF ARTIFICIAL INTELLIGENCE · ARXIV 2607.21461AREX proposes an agent for deep research that recursively improves itself, refining its own research strategies over successive iterations rather than staying fixed. It drew the day's most upvotes on Hugging Face by a wide margin. The work is from the Beijing Academy of Artificial Intelligence.AREX 提出了一种面向深度研究的 agent,它能递归地自我改进,在一次次迭代中优化自身的研究策略,而非固定不变。它以明显优势获得当日 Hugging Face 最多的点赞。该研究来自北京智源人工智能研究院(BAAI)。AREXは、ディープリサーチのためのエージェントを提案する。固定されたままではなく、反復のたびに自らの研究戦略を洗練させ、再帰的に自己改善する。当日のHugging Faceで大差の最多支持を集めた。北京智源人工知能研究院(BAAI)による研究だ。
2ReferTrack: Referring Then Tracking for Embodied Visual TrackingReferTrack:先指代后跟踪的具身视觉追踪ReferTrack:参照してから追跡する身体化視覚トラッキング43 UPVOTES · HANJING YE ET AL. · TENCENT · ARXIV 2607.20061ReferTrack tackles embodied visual tracking by first resolving a natural-language reference to the target, then tracking it, rather than tracking blindly. The two-stage design aims to make an embodied agent follow the object a user actually means. The paper is from Tencent.ReferTrack 处理具身视觉追踪:先根据自然语言指代确定目标,再进行跟踪,而非盲目追踪。这种两阶段设计意在让具身 agent 跟随用户真正所指的物体。论文来自腾讯。ReferTrackは身体化された視覚トラッキングに取り組む。盲目的に追跡するのではなく、まず自然言語の参照から対象を特定し、その上で追跡する。この二段階の設計は、身体化エージェントがユーザーの意図する物体を追えるようにすることを狙う。テンセントによる論文だ。
3K12-KGraph: A Curriculum-Aligned Knowledge Graph for Benchmarking and Training Educational LLMsK12-KGraph:用于评测与训练教育类 LLM 的课程对齐知识图谱K12-KGraph:教育向けLLMの評価と訓練のためのカリキュラム整合ナレッジグラフ40 UPVOTES · HAO LIANG ET AL. · PEKING UNIVERSITY · ARXIV 2605.09635K12-KGraph introduces a knowledge graph aligned to K-12 curricula, built to benchmark and train educational large language models against structured grade-level content. It targets the gap between general LLM knowledge and what students are actually taught. The work comes from Peking University.K12-KGraph 提出了一个与 K-12 课程对齐的知识图谱,用于依据结构化的年级内容来评测和训练教育类大语言模型。它针对的是通用 LLM 知识与学生实际所学之间的差距。该工作来自北京大学。K12-KGraphは、K12カリキュラムに整合したナレッジグラフを提案し、構造化された学年別コンテンツに照らして教育向け大規模言語モデルを評価・訓練する。汎用LLMの知識と、生徒が実際に学ぶ内容との差を埋めることを狙う。北京大学による研究だ。
4Visual Contrastive Self-Distillation视觉对比自蒸馏視覚的コントラスティブ自己蒸留39 UPVOTES · YIJUN LIANG ET AL. · UNIVERSITY OF MARYLAND COLLEGE PARK · ARXIV 2607.21556Visual Contrastive Self-Distillation presents a self-supervised vision method that combines contrastive learning with self-distillation, letting a model learn visual representations by teaching itself. The approach aims to improve representation quality without extra labels. The paper is from the University of Maryland, College Park.《视觉对比自蒸馏》提出一种自监督视觉方法,将对比学习与自蒸馏结合,让模型通过“自我教学”来学习视觉表征。该方法意在无需额外标注即可提升表征质量。论文来自马里兰大学学院市分校。「視覚的コントラスティブ自己蒸留」は、コントラスティブ学習と自己蒸留を組み合わせた自己教師あり視覚手法を提案し、モデルが自らを教えることで視覚表現を学習できるようにする。追加のラベルなしに表現の質を高めることを狙う。メリーランド大学カレッジパーク校による論文だ。
5Show, Don't Tell: Evaluating Spatial Cognition in Generative Pixels Rather Than LLM TextShow, Don't Tell:在生成像素而非 LLM 文本中评测空间认知Show, Don't Tell:LLMのテキストではなく生成ピクセルで空間認知を評価する34 UPVOTES · XU WANG ET AL. · ZJU-OMNIAI · ARXIV 2607.21072This paper argues spatial cognition should be evaluated by what generative models draw, not what LLMs say, and builds a benchmark that scores spatial understanding directly in generated pixels. It contends text-based tests miss capabilities and failures visible only in imagery. The work is from ZJU-OmniAI.该论文主张:空间认知应通过生成模型“画出”的内容来评测,而非 LLM“说出”的内容,并构建了一个直接在生成像素中评分空间理解的基准。作者认为,基于文本的测试会遗漏只有在图像中才可见的能力与缺陷。该工作来自 ZJU-OmniAI。本論文は、空間認知はLLMが「語る」内容ではなく生成モデルが「描く」内容で評価すべきだと主張し、生成ピクセルの中で空間理解を直接採点するベンチマークを構築する。テキストベースのテストは、画像でしか見えない能力や失敗を見落とすと論じる。ZJU-OmniAIによる研究だ。
2026-07-23 · THURSDAY · 23:34 PDT
1Generative World Renderer at the Speed of Play以游玩速度运行的生成式世界渲染器プレイ速度で動く生成的ワールドレンダラー67 UPVOTES · GUIXU LIN ET AL. · ALAYA LAB · ARXIV 2607.18703The paper introduces a generative world renderer that produces game-like visual worlds fast enough to run at interactive play speed. It frames real-time world generation as a rendering problem a single model can drive rather than a slow offline pipeline. The work drew the day's most upvotes on Hugging Face.论文提出了一种生成式世界渲染器,能生成类似游戏的视觉世界,速度快到可在交互式游玩帧率下运行。它把实时世界生成视为可由单一模型驱动的渲染问题,而非缓慢的离线流程。该研究获得了当日 Hugging Face 上最多的点赞。本論文は、ゲームのような視覚世界を対話的なプレイ速度で生成できる生成的ワールドレンダラーを提案する。リアルタイムの世界生成を、遅いオフライン処理ではなく単一モデルで駆動できるレンダリング問題として定式化する。当日Hugging Faceで最多の支持を集めた。
2Mage-Flow: An Efficient Native-Resolution Foundation Model for Image Generation and EditingMage-Flow:面向图像生成与编辑的高效原生分辨率基础模型Mage-Flow:画像生成・編集のための効率的なネイティブ解像度基盤モデル60 UPVOTES · XINJIE ZHANG ET AL. · MICROSOFT · ARXIV 2607.19064Microsoft researchers present Mage-Flow, a compact foundation model for image generation and instruction-based editing that operates at native resolution instead of upscaling from a fixed low-resolution latent. The paper emphasizes efficiency at full resolution over raw parameter count. It was among the day's most-upvoted submissions.微软研究者提出 Mage-Flow,一款用于图像生成和基于指令编辑的紧凑基础模型,直接在原生分辨率上工作,而非从固定的低分辨率隐空间上采样。论文强调全分辨率下的效率,而非单纯堆参数。它是当日点赞最多的投稿之一。マイクロソフトの研究者らは、固定の低解像度潜在からのアップスケールではなくネイティブ解像度で動作する、画像生成と指示ベース編集向けのコンパクトな基盤モデルMage-Flowを提案した。論文はパラメータ数よりも全解像度での効率を重視する。当日最も支持された投稿の一つだった。
3SLAI T-Rex: Full-Parameter Post-training of the DeepSeek-V4 Family on Ascend SuperPODSLAI T-Rex:在昇腾 SuperPOD 上对 DeepSeek-V4 系列做全参数后训练SLAI T-Rex:Ascend SuperPODでのDeepSeek-V4ファミリーの全パラメータ事後学習54 UPVOTES · DONGFANG LI ET AL. · ARXIV 2607.20145The paper documents full-parameter post-training of the DeepSeek-V4 model family on Huawei's Ascend SuperPOD, a large-scale run outside the usual Nvidia stack. It details the systems engineering needed to fine-tune frontier-scale models on Ascend hardware. It ranked among the day's top papers.论文记录了在华为昇腾 SuperPOD 上对 DeepSeek-V4 模型系列进行全参数后训练的过程,这是一次脱离常见 Nvidia 生态的大规模实践。它详述了在昇腾硬件上微调前沿规模模型所需的系统工程。该研究位列当日热门论文之一。本論文は、通常のNvidiaスタック外での大規模な取り組みとして、HuaweiのAscend SuperPOD上でDeepSeek-V4ファミリーの全パラメータ事後学習を行った過程を記録する。Ascendハードウェアでフロンティア規模のモデルを微調整するために必要なシステム工学を詳述する。当日の上位論文に入った。
4Subliminal Clocks: Latent Time Modelling in Diffusion Language Models潜时钟:扩散语言模型中的隐式时间建模サブリミナル・クロック:拡散言語モデルにおける潜在的な時間モデリング36 UPVOTES · MAXIMO EDUARDO RULLI ET AL. · SAPIENZA UNIVERSITY OF ROME · ARXIV 2607.01774This paper studies how diffusion language models implicitly track progress through generation, proposing latent 'subliminal clocks' that encode timing inside the denoising process. It offers a lens on how such models order their output without explicit autoregression. The work came from Sapienza University of Rome.论文研究扩散语言模型如何隐式地追踪生成进度,提出在去噪过程内部编码时序的潜在“潜时钟”。它为理解这类模型在没有显式自回归的情况下如何安排输出顺序提供了视角。该工作来自罗马大学(Sapienza)。本論文は、拡散言語モデルが生成の進行を暗黙的にどう追跡するかを調べ、ノイズ除去過程の内部に時間を符号化する潜在的な「サブリミナル・クロック」を提案する。明示的な自己回帰なしにこれらのモデルが出力を順序付ける仕組みへの視点を与える。ローマ・サピエンツァ大学による研究だ。
5Stale but Stable: Staleness-Adaptive Trust Regions for Stabilizing Asynchronous Reinforcement Learning陈旧亦稳定:用陈旧度自适应信赖域稳定异步强化学习古くても安定:非同期強化学習を安定化する陳腐化適応型トラスト領域31 UPVOTES · JUNYAO YANG ET AL. · TENCENT HUNYUAN · ARXIV 2607.18722Tencent Hunyuan researchers propose a staleness-adaptive trust region to stabilize asynchronous reinforcement learning, where updates computed on outdated policy copies can destabilize training. The method scales each update's trust region by how stale it is. It aims at faster yet more stable large-scale RL.腾讯混元的研究者提出一种陈旧度自适应信赖域方法,用以稳定异步强化学习——在异步训练中,基于过时策略副本计算的更新可能破坏训练稳定性。该方法按每次更新的陈旧程度来缩放其信赖域,目标是让大规模强化学习既更快又更稳。テンセント混元の研究者らは、非同期強化学習を安定化する陳腐化適応型トラスト領域を提案する。非同期学習では、古いポリシーのコピーで計算された更新が学習を不安定にしうる。本手法は各更新の陳腐度に応じてトラスト領域を調整する。大規模RLをより速く、かつ安定にすることを狙う。
2ABot-World-0: Infinite Interactive World Rollout on a Single Desktop GPUABot-World-0:面向机器人的无限交互式世界模型ABot-World-0:ロボット向け無限インタラクティブ世界モデル170 UPVOTES · FAN JIANG ET AL. · ALIBABA AMAP CV LAB · ARXIV 2607.19191Alibaba's AMAP CV Lab introduces ABot-World-0, an action-conditioned video world model for real-time, long-horizon interactive rollout - a step toward world models robots can plan against.阿里 AMAP CV 实验室提出 ABot-World-0,一个以动作为条件的视频世界模型,支持实时、长时程的交互式推演——朝着机器人可据以规划的世界模型迈进一步。アリババのAMAP CV Labは、行動条件付きの動画世界モデルABot-World-0を発表。リアルタイムかつ長期の対話的ロールアウトを可能にし、ロボットが計画に使える世界モデルへ一歩近づく。
4SWE-Pruner Pro: The Coder LLM Already Knows What to PruneSWE-Pruner Pro:编码智能体其实已知道该保留什么SWE-Pruner Pro:コーディングエージェントは残すべき文脈を既に知っている71 UPVOTES · YUHANG WANG ET AL. · BYTEDANCE · ARXIV 2607.18213ByteDance's SWE-Pruner Pro prunes long context for coding agents by using the coder model's own signals about what matters, cutting tokens while keeping the context an agent actually needs.字节跳动的 SWE-Pruner Pro 借助编码模型自身对"什么重要"的信号来裁剪长上下文,在削减 token 的同时保留智能体真正需要的上下文。バイトダンスのSWE-Pruner Proは、何が重要かというコーダーモデル自身のシグナルを使ってコーディングエージェントの長い文脈を刈り込み、トークンを削りつつ本当に必要な文脈を残す。
5Text Template Tokens Are Implicit Semantic Registers in Diffusion Transformers文本模板 token 是隐式的语义寄存器テキストテンプレートトークンは暗黙の意味レジスタである67 UPVOTES · MAOHUA LI ET AL. · RTP-LLM · ARXIV 2607.19139This paper studies text-to-image diffusion transformers and argues the template tokens they process act as implicit semantic registers, offering a new handle on how DiTs bind text to image.该论文研究文生图扩散 Transformer,提出其处理的模板 token 充当隐式的语义寄存器,为理解 DiT 如何把文本绑定到图像提供了新的抓手。本論文はテキスト画像拡散トランスフォーマー(DiT)を調べ、処理されるテンプレートトークンが暗黙の意味レジスタとして働くと論じ、DiTがテキストを画像へ結びつける仕組みへの新たな手がかりを与える。
2026-07-21 · TUESDAY
1TimeLens2: Generalist Video Temporal Grounding with Multimodal LLMsTimeLens2:面向通用视频时序定位的多模态大模型TimeLens2:汎用ビデオ時間グラウンディング137 UPVOTES · YUHAN ZHU ET AL. · MULTIMEDIA COMPUTING GROUP-NANJING UNIVERSITY · ARXIV 2607.17423Video MLLMs can describe what happens in a video but rarely when the supporting evidence occurs. TimeLens2 targets generalist temporal grounding - locating the moments that back an answer across video tasks.视频多模态大模型能描述视频里发生了什么,却很少能说出证据出现在何时。TimeLens2 面向通用时序定位:在各类视频任务中找到支撑答案的具体时刻。動画MLLMは何が起きたかは説明できても、その根拠がいつ現れるかはほとんど示せない。TimeLens2は汎用の時間グラウンディング、つまり答えを裏付ける瞬間の特定に挑む。
5BadWAM: When World-Action Models Dream Right but Act WrongBadWAM:当世界-行动模型梦得对却做得错BadWAM:世界行動モデルが正しく夢を見て誤って動くとき37 UPVOTES · QI LI ET AL. · ARXIV 2607.15207Examines world-action models that predict the future correctly yet still act wrongly - an embodied-control failure mode where dreaming right does not mean acting right.研究“世界-行动模型”预测未来正确却行动错误的现象——一种具身控制的失效模式:梦得对不代表做得对。世界行動モデル(WAM)が未来を正しく予測しながら誤った行動を取る現象を分析。「正しく夢を見ても正しく動ける」とは限らないという身体性制御の失敗モードを示す。