InfiLoop:用循环原生注意力残差将测试时迭代扩展至数万次
研究者提出循环原生残差连接 InfiLoop,让循环 Transformer 在迭代次数增长时不再性能退化,它通过内容加权与学习式时间衰减维护循环状态的持续摘要,并以精确流式递归保持聚合内存恒定。
研究者提出循环原生残差连接 InfiLoop,让循环 Transformer 在迭代次数增长时不再性能退化,它通过内容加权与学习式时间衰减维护循环状态的持续摘要,并以精确流式递归保持聚合内存恒定。
LEGO 提出一种无需 lifting 的第三人称到第一人称视频生成方法,用 LVSM 风格的 Transformer 直接渲染第一人称视角,省去深度估计、点云和重投影步骤。该合成器输出逐区域置信度,用于遮蔽低置信区域并在去噪早期引导生成器布局,性能持续优于现有显式流程,且无需重训练即可泛化到其他数据集。
SpatialOPSD 是一个 on-policy 自蒸馏框架,将空间编码智能体已验证的执行轨迹作为特权信息,把空间推理能力内化进独立 MLLM,使其无需外部工具即可运行。
研究者推出 SpaceCast-Bench,首个直接诊断预测性空间推理的基准,基于 observe-transform-infer 框架,从 182 个真实场景构建 3,862 道题,覆盖静态感知、局部预测与全局预测三个层级共 16 种任务。
针对视觉语言模型空间推理弱、RGB 输入缺乏几何证据的问题,研究者提出 GPD(Geometry-Privileged Distillation),将深度、语义和鸟瞰图(BEV)线索渲染为紧凑文本并按问题路由给教师模型,仅对错误轨迹施加特权 KL 以增强 GRPO,部署模型仍只用 RGB。
MiMo-V2.6 系列是一套全模态模型家族,通过扩展强化学习算力推进模型智能。其 RL 扩展沿三个方向进行:每步消耗 1,568 个样本、2.7-3.7B tokens,上下文长度最高 1M;环境覆盖代码、通用、视觉与网络领域;并采用分组式智能体评分提供更准确的奖励信号。团队冻结 MoE 路由器并建立多层防御以抑制奖励攻击,同时开源训练动态、RL 环境与 RL 框架。
推荐理由:报告公开了 MiMo-V2.6 的 RL 训练动态、环境与框架,可供研究大规模强化学习与自我改进的读者参考复现。
针对 N-version 目标检测,研究者提出 Cov_OD 和 Cer_OD 两项可靠性度量,可直接从各模型或输入帧的单独检测结果计算,无需依赖投票策略。现有 mAP、Accuracy 等指标只反映聚合后的最终结果,无法刻画多检测结果间的多样性与一致性。在自动驾驶模拟器的车辆案例中,这两项指标可用于筛选误差特性互补的版本组合、依据多样性与一致性选择投票策略,并通过两两版本分析指导系统增量构建。
Anthropic 发布 Claude Haiku 5.5,这是其最快、最便宜的小模型,平均成本比 Haiku 4.5 低约 75%,提示词不超过 10 万 token 的请求价格最高下降 90%,超过 10 万 token 的请求价格则是前者的五倍。
推荐理由:Anthropic 发布 Haiku 5.5 并大幅降价,读者可据此判断小模型在成本敏感任务中的定位与取舍。
Anthropic 发布快速低价模型 Claude Haiku 5.5,定价与 OpenAI 上月发布的 GPT-6 Luna 完全一致,为 $0.10/$0.50 每百万 token,超过 100,000 token 后涨价 5 倍至 $0.50/$2.50。
AWS 宣布 Claude Haiku 5.5 在 Amazon Bedrock 和 Claude Platform on AWS 上线。
推荐理由:AWS 官方给出 Haiku 5.5 的定位、成本变化与 Bedrock 接入方式,可据此判断它在多智能体分层中的分工。
英伟达团队基于 Nemotron 3,用监督微调、强化学习和反馈驱动的推理流程,在 IOI 2026 和 IMO 2026 两项竞赛中均达到金牌水平。
推荐理由:原文公开了从 Nemotron 3 微调到 IOI、IMO 金牌级成绩的完整配方与数据集,可据此复现领域专家模型的训练与推理流程。
针对扩散 Transformer 长序列生成中稀疏注意力导致质量下降的问题,研究者提出免训练框架 MC-Sparse,通过缓存查询分组、KV 索引与稠密-稀疏注意力残差并在去噪步骤间复用,实现更高保真度。在 Minimax-H3-Base 上取得 1.80 倍去噪加速,3D 资产生成上达 2.32 倍,质量损失可忽略。
一项受控研究用双人石头剪刀布和单人随机 n-gram 续写任务,测试 LLM 能否识别潜在策略、遵循简单马尔可夫规则并维持高阶条件依赖。结果显示更长的上下文并不能提升识别能力,正确识别也不保证忠实模拟,高阶依赖会显著削弱规则恢复,表面行为保真可能掩盖错误的生成机制。
Google DeepMind 发布新前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向受信任的网络安全防御方开放,随后逐步扩展至开发者、企业和消费者,起步价每百万输入 token 2 美元、输出 token 10 美元。
推荐理由:官方披露了 Argon 在编码、企业知识与网络安全上的基准表现和分阶段开放路径,可据此判断前沿模型的能力边界与获取门槛。
针对 RLVR 中复用 rollout 导致的梯度饥饿问题,研究者提出 ReSPO(Reshaped Sequence Policy Optimization),用基于 α-散度变分目标与指数方差控制倾斜的平滑双分支序列级核函数替代 clipping:正分支为欠生成的正面回复保留非零梯度权重,负分支抑制严重过度生成的负面回复。
Berkeley AI Research 与 IBM Research 将 K-Search 进化式内核搜索框架扩展到 MLX,通过结构化 CUDA-to-MLX 翻译层把已有 CUDA 内核经验迁移到 Apple Silicon。
推荐理由:展示了把 CUDA 内核优化经验结构化迁移到 Apple Silicon 的方法,并给出注意力与 Mamba 两类内核的实测对比。
Berkeley AI Research 提出 ABBEL 框架,将 LLM 的摘要内容以自然语言"信念状态"形式隔离并监督,通过受自编码器启发的信念评分机制提升长程交互效率。在协作编程基准 CollabBench 上,采用重建式信念评分的 ABBEL-rec-BG 将全上下文模型的性能差距缩小约 50%,训练步数从 100 降至 50,峰值 token 数也显著低于全上下文设置。
伯克利 AI 研究团队提出 GRASP,一种面向学习型世界模型的基于梯度的规划器,通过将轨迹提升到虚拟状态实现跨时间并行优化、在状态迭代上直接注入随机性以探索、并重塑梯度让动作获得清晰信号,从而让长时程规划变得可行。该方法针对长时程规划中梯度爆炸/消失、非贪心结构导致的局部极小值以及高维视觉模型带来的脆弱"状态-输入"梯度问题。
Berkeley AI Research 提出 SPEX 与 ProxySPEX 算法,可在特征、数据与模型组件归因中大规模识别驱动 LLM 输出的关键交互。SPEX 利用稀疏性与低阶性将交互搜索转化为稀疏恢复问题,ProxySPEX 进一步借助层级结构,以约少 10 倍的消融次数达到 SPEX 的性能。