llama.cpp b11513 发布:CUDA top-k 算法按形状选择,qwen4exp 上提速约 6 倍
llama.cpp 发布 b11513,为 CUDA 后端改进 top-k 算法选择:按形状在 bitonic、radix select 与 DeviceTopK/CUB argsort 之间切换,阈值可在构建时覆盖。
llama.cpp 发布 b11513,为 CUDA 后端改进 top-k 算法选择:按形状在 bitonic、radix select 与 DeviceTopK/CUB argsort 之间切换,阈值可在构建时覆盖。
Anthropic 发布 Claude Haiku 5.5,这是其最快、最便宜的小模型,平均成本比 Haiku 4.5 低约 75%,提示词不超过 10 万 token 的请求价格最高下降 90%,超过 10 万 token 的请求价格则是前者的五倍。
推荐理由:Anthropic 发布 Haiku 5.5 并大幅降价,读者可据此判断小模型在成本敏感任务中的定位与取舍。
Anthropic 发布快速低价模型 Claude Haiku 5.5,定价与 OpenAI 上月发布的 GPT-6 Luna 完全一致,为 $0.10/$0.50 每百万 token,超过 100,000 token 后涨价 5 倍至 $0.50/$2.50。
AWS 宣布 Claude Haiku 5.5 在 Amazon Bedrock 和 Claude Platform on AWS 上线。
推荐理由:AWS 官方给出 Haiku 5.5 的定位、成本变化与 Bedrock 接入方式,可据此判断它在多智能体分层中的分工。
英伟达团队基于 Nemotron 3,用监督微调、强化学习和反馈驱动的推理流程,在 IOI 2026 和 IMO 2026 两项竞赛中均达到金牌水平。
推荐理由:原文公开了从 Nemotron 3 微调到 IOI、IMO 金牌级成绩的完整配方与数据集,可据此复现领域专家模型的训练与推理流程。
vLLM 发布 v0.31.0,含 307 位贡献者的 717 个提交,重点优化 DeepSeek-V4.1-Flash:FlashMLA mega attention 搭配 NVFP4 压缩 KV cache 成为 SM100 默认配置。
针对扩散 Transformer 长序列生成中稀疏注意力导致质量下降的问题,研究者提出免训练框架 MC-Sparse,通过缓存查询分组、KV 索引与稠密-稀疏注意力残差并在去噪步骤间复用,实现更高保真度。在 Minimax-H3-Base 上取得 1.80 倍去噪加速,3D 资产生成上达 2.32 倍,质量损失可忽略。
一项受控研究用双人石头剪刀布和单人随机 n-gram 续写任务,测试 LLM 能否识别潜在策略、遵循简单马尔可夫规则并维持高阶条件依赖。结果显示更长的上下文并不能提升识别能力,正确识别也不保证忠实模拟,高阶依赖会显著削弱规则恢复,表面行为保真可能掩盖错误的生成机制。
SGLang 发布 v0.5.21,合并 227 位贡献者的 779 个 PR,新增 DeepSeek-V4.1 Flash、GigaChat 3.5、MiMo-V2.6、Qwen-Image 2.1、FLUX 3 Action 等模型支持。
OpenAI 在 API 以及符合条件的 ChatGPT Work 和 Codex 用户中上线 GPT-6 Astra Ultrafast,该模式运行在 NVIDIA Blackwell GPU 上,token 生成速度最高可达 Astra Standard 模式的 8 倍。
推荐理由:原文给出 Ultrafast 模式相对标准模式的生成速度提升与开放入口,读者可据此判断它对编码智能体循环的实际影响。
Google DeepMind 发布新前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向受信任的网络安全防御方开放,随后逐步扩展至开发者、企业和消费者,起步价每百万输入 token 2 美元、输出 token 10 美元。
推荐理由:官方披露了 Argon 在编码、企业知识与网络安全上的基准表现和分阶段开放路径,可据此判断前沿模型的能力边界与获取门槛。
Google 分享了在 TPU 上将视频扩散模型稀疏注意力理论转化为端到端加速的案例。81 帧 720p 视频的序列长度达 50K 至 400K,从 720p 升至 1440p 时序列长度翻两番,全注意力在单层延迟中占比可从 55.5% 升至 88.2%。
Unsloth 新增决策模型支持,可在本地运行 Laya(开源 Jev)回答是/否、多选和评分问题并输出概率,通过 Settings > API 启用 Decision API,支持 TypeSafe SDK 的 Jev 兼容 /v1/systemone 端点。
TensorRT-LLM 发布 v1.3.0rc29,新增对 Qwen3.5 全局 FP8 权重、Kimi K3 NVFP4 SiTU 的 CuTeDSL MoE 后端以及 DeepSeek V4 NVFP4 MLA 残差开关的支持。
Import AI 第 474 期聚焦三项内容:Michael Levin 提出心智是来自柏拉图式模式空间的模式,身体与机器只是其进入物理世界的接口。智谱启动了一个"外层 RSI 循环",探索递归自我改进。此外还讨论了将 TPU 部署到太空,以及机器人领域正为 LLM 时刻做准备但缺少通用算法。
针对 RLVR 中复用 rollout 导致的梯度饥饿问题,研究者提出 ReSPO(Reshaped Sequence Policy Optimization),用基于 α-散度变分目标与指数方差控制倾斜的平滑双分支序列级核函数替代 clipping:正分支为欠生成的正面回复保留非零梯度权重,负分支抑制严重过度生成的负面回复。
TensorRT-LLM 发布 v1.3.0rc28,新增 DFlash 2 支持并为 Llama、Llama4 默认启用 KV-cache manager V2,同时扩展 Qwen3.8-Flash-Next 的 disaggregation、MegaMoE 与 GVR index reuse 支持。
SGLang 发布 v0.5.20,包含 237 位贡献者的 713 个 PR,新增 GLM-5.3-Flash、Qwen3.8-Flash-Next、Hy4-Preview、K2 Horizon、Nanbeige4.2 等模型支持。
TensorRT-LLM 发布 v1.3.0rc27,新增 MiniMax-H3 VisualGen 文生视频与首尾帧生视频支持(BF16 和 FP8 blockwise),并支持 Nemotron 3.5 Super VL 多模态服务。
TensorRT-LLM 发布 v1.3.0rc26,新增 DeepSeek-V4 Hopper、Qwen3.8-Flash-Next 支持,并在 B200 上启用 Kimi K3。
SGLang 发布 v0.5.19,合并 214 位贡献者的 786 个 PR,新增 Qwen3.8(2.4T-A95B)、Qwen3.8-27B、Ling-3.0-flash、Spark2.5、Granite 4.2 等模型支持。
LMDeploy 发布 v0.17.0,新增对 Kimi K2.6 和 DeepEPv2 的支持,并集成 mooncake store 作为 KV connector。该版本进一步优化 GLM-5.2 服务性能,在 CUDA 上为 paged attention 和 V4 prefill 引入 PDL,同时降低投机解码前后处理开销,并支持非 2 的幂次 page size。
TensorRT-LLM v1.3.0rc25 将 KV cache manager V2 设为 DeepSeek V3/R1/V3 Lite、DeepSeek V3.2/V4。
SGLang 发布 v0.5.18,合并 212 位贡献者的 710 个 PR,新增 Muse Glimmer、Intern-S2-Mobius、SANA-Video、LTX-2.5、Cosmos3、LongCat-Image 等模型支持。
METR 研究显示 AI 对科学的加速并不均衡:2026 年网络安全漏洞报告速度较 2025 年大幅加快,数学领域贡献有限,AI 研究本身尚无显著加速。多校团队提出 SPADE 框架,通过自博弈让 LLM 交替生成可执行训练环境并求解,在 Qwen3-30B-A3B 上游戏环境套件均分达 58.3,较基线提升 8.1。
TensorRT-LLM 发布 v1.3.0rc24,新增 Kimi K3(含 KDA kernel、优化 MoE、投机解码与分离式服务)、MiniCPM-V 4.6 图像视频支持,以及 PyTorch 后端的 Whisper 支持。
SGLang v0.5.17 发布,含 194 位贡献者的 582 个 PR,首日支持 2.8T 参数多模态模型 Kimi K3 和 MiniMax-H3 视频生成模型。
LMDeploy 发布 v0.15.0,新增 DeepSeek V4 支持,并支持长上下文与 MTP 前缀缓存命中。该版本为投机解码加入引导式解码支持,新增 AgRs all2all 后端与 memdecode 支持,同时优化 TTFT 并改进 Ascend-A3 多节点支持。
Berkeley AI Research 与 IBM Research 将 K-Search 进化式内核搜索框架扩展到 MLX,通过结构化 CUDA-to-MLX 翻译层把已有 CUDA 内核经验迁移到 Apple Silicon。
推荐理由:展示了把 CUDA 内核优化经验结构化迁移到 Apple Silicon 的方法,并给出注意力与 Mamba 两类内核的实测对比。
Berkeley AI Research 提出 ABBEL 框架,将 LLM 的摘要内容以自然语言"信念状态"形式隔离并监督,通过受自编码器启发的信念评分机制提升长程交互效率。在协作编程基准 CollabBench 上,采用重建式信念评分的 ABBEL-rec-BG 将全上下文模型的性能差距缩小约 50%,训练步数从 100 降至 50,峰值 token 数也显著低于全上下文设置。
SGLang 发布 v0.5.16,包含 169 位贡献者的 574 个 PR。新投机解码算法 DSpark 在 DeepSeek-V4-Pro 上达到 383.7 tok/s,新增 975B 参数、1M token 上下文的 Inkling 多模态 MoE 模型支持。该版本还移除 QServe 与 FBGEMM FP8 量化路径,NVFP4 GEMM 现需 FlashInfer。
SGLang v0.5.15 发布,针对 Blackwell 调优的 GLM-5.2 NVFP4 在 8x B300 上实现 500+ tok/s/user、4x GB300 上 450 tok/s/user(bs=1)。
LMDeploy 发布 v0.14.0,新增 FP8 KV cache 量化、Qwen3 Omni 支持,并在 turbomind 后端支持 Qwen3.5(vit)推理。该版本还加入 OpenAI Responses 兼容端点和 /get_ppl 接口,并扩展 chat completions 支持 token-in/out 与返回 routed experts。
LMDeploy 发布 v0.14.0a2,新增 FP8 KV cache 量化、Qwen3 Omni 支持,并在 turbomind 后端支持 Qwen3.5(vit)推理。该版本还加入 OpenAI Responses 兼容端点,扩展 chat completions 与 v1/messages 的 token 输入输出并返回 routed experts。
LMDeploy 发布 v0.13.0,新增 Anthropic 兼容服务端点,并支持 TurboQuant(quant_policy=42)的 KV Cache 量化。
伯克利 AI 研究团队梳理了并行推理领域进展,指出当前多数方法(如 Self-consistency、Best-of-N、Tree of Thoughts、MCTS、ParaThinker、GroupThink、Hogwild!
伯克利 AI 研究团队提出 GRASP,一种面向学习型世界模型的基于梯度的规划器,通过将轨迹提升到虚拟状态实现跨时间并行优化、在状态迭代上直接注入随机性以探索、并重塑梯度让动作获得清晰信号,从而让长时程规划变得可行。该方法针对长时程规划中梯度爆炸/消失、非贪心结构导致的局部极小值以及高维视觉模型带来的脆弱"状态-输入"梯度问题。
Berkeley AI Research 提出 SPEX 与 ProxySPEX 算法,可在特征、数据与模型组件归因中大规模识别驱动 LLM 输出的关键交互。SPEX 利用稀疏性与低阶性将交互搜索转化为稀疏恢复问题,ProxySPEX 进一步借助层级结构,以约少 10 倍的消融次数达到 SPEX 的性能。