跳到正文
今天10月9日周五1 条
10月8日周四
  1. The Decoder77

    Anthropic 发布 Claude Haiku 5.5,价格最高下调 90%

    Anthropic 发布 Claude Haiku 5.5,这是其最快、最便宜的小模型,平均成本比 Haiku 4.5 低约 75%,提示词不超过 10 万 token 的请求价格最高下降 90%,超过 10 万 token 的请求价格则是前者的五倍。

    推荐理由:Anthropic 发布 Haiku 5.5 并大幅降价,读者可据此判断小模型在成本敏感任务中的定位与取舍。

10月7日周三
10月6日周二
10月5日周一
  1. Hugging Face Daily Papers31

    MC-Sparse:弥合扩散 Transformer 中稠密与稀疏注意力的差距

    针对扩散 Transformer 长序列生成中稀疏注意力导致质量下降的问题,研究者提出免训练框架 MC-Sparse,通过缓存查询分组、KV 索引与稠密-稀疏注意力残差并在去噪步骤间复用,实现更高保真度。在 Minimax-H3-Base 上取得 1.80 倍去噪加速,3D 资产生成上达 2.32 倍,质量损失可忽略。

10月4日周日
  1. Hugging Face Daily Papers22

    LLM 能否理解序列结构?一项关于推理与生成的受控研究

    一项受控研究用双人石头剪刀布和单人随机 n-gram 续写任务,测试 LLM 能否识别潜在策略、遵循简单马尔可夫规则并维持高阶条件依赖。结果显示更长的上下文并不能提升识别能力,正确识别也不保证忠实模拟,高阶依赖会显著削弱规则恢复,表面行为保真可能掩盖错误的生成机制。

10月3日周六
10月2日周五
  1. NVIDIA Blog78

    NVIDIA GPU 如何加速 OpenAI GPT-6 Astra Ultrafast

    OpenAI 在 API 以及符合条件的 ChatGPT Work 和 Codex 用户中上线 GPT-6 Astra Ultrafast,该模式运行在 NVIDIA Blackwell GPU 上,token 生成速度最高可达 Astra Standard 模式的 8 倍。

    推荐理由:原文给出 Ultrafast 模式相对标准模式的生成速度提升与开放入口,读者可据此判断它对编码智能体循环的实际影响。

10月1日周四
  1. Google DeepMind84

    Google DeepMind 发布 Gemini 4 Argon 前沿模型

    Google DeepMind 发布新前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向受信任的网络安全防御方开放,随后逐步扩展至开发者、企业和消费者,起步价每百万输入 token 2 美元、输出 token 10 美元。

    推荐理由:官方披露了 Argon 在编码、企业知识与网络安全上的基准表现和分阶段开放路径,可据此判断前沿模型的能力边界与获取门槛。

9月30日周三
9月29日周二
9月28日周一
  1. Import AI38

    Import AI 474:柏拉图式心智空间、太空中的 TPU、智谱启动外层 RSI 循环

    Import AI 第 474 期聚焦三项内容:Michael Levin 提出心智是来自柏拉图式模式空间的模式,身体与机器只是其进入物理世界的接口。智谱启动了一个"外层 RSI 循环",探索递归自我改进。此外还讨论了将 TPU 部署到太空,以及机器人领域正为 LLM 时刻做准备但缺少通用算法。

  2. Hugging Face Daily Papers22

    ReSPO:重塑序列策略优化,解决离策略学习中的梯度饥饿问题

    针对 RLVR 中复用 rollout 导致的梯度饥饿问题,研究者提出 ReSPO(Reshaped Sequence Policy Optimization),用基于 α-散度变分目标与指数方差控制倾斜的平滑双分支序列级核函数替代 clipping:正分支为欠生成的正面回复保留非零梯度权重,负分支抑制严重过度生成的负面回复。

9月23日周三
9月19日周六
9月18日周五
9月9日周三
9月5日周六
9月1日周二
8月31日周一
8月25日周二
8月24日周一
  1. Import AI22

    Import AI 470:机器不应享有权利;SPADE 自动化环境生成;Hawkeye 构建更优 GPU 内核

    METR 研究显示 AI 对科学的加速并不均衡:2026 年网络安全漏洞报告速度较 2025 年大幅加快,数学领域贡献有限,AI 研究本身尚无显著加速。多校团队提出 SPADE 框架,通过自博弈让 LLM 交替生成可执行训练环境并求解,在 Qwen3-30B-A3B 上游戏环境套件均分达 58.3,较基线提升 8.1。

8月12日周三
8月11日周二
7月31日周五
7月29日周三
  1. Berkeley AI Research62

    从 CUDA 到 MLX:K-Search 如何把内核优化经验带到 Apple Silicon

    Berkeley AI Research 与 IBM Research 将 K-Search 进化式内核搜索框架扩展到 MLX,通过结构化 CUDA-to-MLX 翻译层把已有 CUDA 内核经验迁移到 Apple Silicon。

    推荐理由:展示了把 CUDA 内核优化经验结构化迁移到 Apple Silicon 的方法,并给出注意力与 Mamba 两类内核的实测对比。

7月26日周日
  1. Berkeley AI Research32

    Berkeley AI Research 提出 ABBEL:用信念状态监督 LLM 长程交互中的摘要更新

    Berkeley AI Research 提出 ABBEL 框架,将 LLM 的摘要内容以自然语言"信念状态"形式隔离并监督,通过受自编码器启发的信念评分机制提升长程交互效率。在协作编程基准 CollabBench 上,采用重建式信念评分的 ABBEL-rec-BG 将全上下文模型的性能差距缩小约 50%,训练步数从 100 降至 50,峰值 token 数也显著低于全上下文设置。

7月25日周六
7月11日周六
6月24日周三
6月16日周二
5月12日周二
5月8日周五
4月20日周一
  1. Berkeley AI Research40

    GRASP:面向世界模型的基于梯度的长时程规划器

    伯克利 AI 研究团队提出 GRASP,一种面向学习型世界模型的基于梯度的规划器,通过将轨迹提升到虚拟状态实现跨时间并行优化、在状态迭代上直接注入随机性以探索、并重塑梯度让动作获得清晰信号,从而让长时程规划变得可行。该方法针对长时程规划中梯度爆炸/消失、非贪心结构导致的局部极小值以及高维视觉模型带来的脆弱"状态-输入"梯度问题。

3月13日周五