可见推理并非通用优化器:分析代码生成中的人设与思考依赖效应
一项基于 SQL-pandas 匹配查询基准的研究发现,可见 CoT 并不带来普遍准确率优势,让推理表示匹配目标语言(如"用 SQL 思考")也无一致收益。效果取决于人设、目标语言、模型配置与内部推理设置,控制消融实验进一步区分了推理内容与提示词格式的影响。研究认为推理策略应针对模型、人设、目标和内部推理配置联合选择,而非作为通用默认。
一项基于 SQL-pandas 匹配查询基准的研究发现,可见 CoT 并不带来普遍准确率优势,让推理表示匹配目标语言(如"用 SQL 思考")也无一致收益。效果取决于人设、目标语言、模型配置与内部推理设置,控制消融实验进一步区分了推理内容与提示词格式的影响。研究认为推理策略应针对模型、人设、目标和内部推理配置联合选择,而非作为通用默认。
研究者提出一个仅凭源码和输入预测程序最终输出与检查点状态的基准,包含来自 371 个 Python 和 C++ 程序的 400 个案例,在四个模型系列的七种设置下评估。
llama.cpp 发布 b11513,为 CUDA 后端改进 top-k 算法选择:按形状在 bitonic、radix select 与 DeviceTopK/CUB argsort 之间切换,阈值可在构建时覆盖。
vLLM 发布 v0.31.0,含 307 位贡献者的 717 个提交,重点优化 DeepSeek-V4.1-Flash:FlashMLA mega attention 搭配 NVFP4 压缩 KV cache 成为 SM100 默认配置。
SGLang 发布 v0.5.21,合并 227 位贡献者的 779 个 PR,新增 DeepSeek-V4.1 Flash、GigaChat 3.5、MiMo-V2.6、Qwen-Image 2.1、FLUX 3 Action 等模型支持。
OpenAI 在 API 以及符合条件的 ChatGPT Work 和 Codex 用户中上线 GPT-6 Astra Ultrafast,该模式运行在 NVIDIA Blackwell GPU 上,token 生成速度最高可达 Astra Standard 模式的 8 倍。
推荐理由:原文给出 Ultrafast 模式相对标准模式的生成速度提升与开放入口,读者可据此判断它对编码智能体循环的实际影响。
Unsloth 新增决策模型支持,可在本地运行 Laya(开源 Jev)回答是/否、多选和评分问题并输出概率,通过 Settings > API 启用 Decision API,支持 TypeSafe SDK 的 Jev 兼容 /v1/systemone 端点。
TensorRT-LLM 发布 v1.3.0rc29,新增对 Qwen3.5 全局 FP8 权重、Kimi K3 NVFP4 SiTU 的 CuTeDSL MoE 后端以及 DeepSeek V4 NVFP4 MLA 残差开关的支持。
TensorRT-LLM 发布 v1.3.0rc28,新增 DFlash 2 支持并为 Llama、Llama4 默认启用 KV-cache manager V2,同时扩展 Qwen3.8-Flash-Next 的 disaggregation、MegaMoE 与 GVR index reuse 支持。
SGLang 发布 v0.5.20,包含 237 位贡献者的 713 个 PR,新增 GLM-5.3-Flash、Qwen3.8-Flash-Next、Hy4-Preview、K2 Horizon、Nanbeige4.2 等模型支持。
TensorRT-LLM 发布 v1.3.0rc27,新增 MiniMax-H3 VisualGen 文生视频与首尾帧生视频支持(BF16 和 FP8 blockwise),并支持 Nemotron 3.5 Super VL 多模态服务。
TensorRT-LLM 发布 v1.3.0rc26,新增 DeepSeek-V4 Hopper、Qwen3.8-Flash-Next 支持,并在 B200 上启用 Kimi K3。
SGLang 发布 v0.5.19,合并 214 位贡献者的 786 个 PR,新增 Qwen3.8(2.4T-A95B)、Qwen3.8-27B、Ling-3.0-flash、Spark2.5、Granite 4.2 等模型支持。
LMDeploy 发布 v0.17.0,新增对 Kimi K2.6 和 DeepEPv2 的支持,并集成 mooncake store 作为 KV connector。该版本进一步优化 GLM-5.2 服务性能,在 CUDA 上为 paged attention 和 V4 prefill 引入 PDL,同时降低投机解码前后处理开销,并支持非 2 的幂次 page size。
TensorRT-LLM v1.3.0rc25 将 KV cache manager V2 设为 DeepSeek V3/R1/V3 Lite、DeepSeek V3.2/V4。
SGLang 发布 v0.5.18,合并 212 位贡献者的 710 个 PR,新增 Muse Glimmer、Intern-S2-Mobius、SANA-Video、LTX-2.5、Cosmos3、LongCat-Image 等模型支持。
TensorRT-LLM 发布 v1.3.0rc24,新增 Kimi K3(含 KDA kernel、优化 MoE、投机解码与分离式服务)、MiniCPM-V 4.6 图像视频支持,以及 PyTorch 后端的 Whisper 支持。
SGLang v0.5.17 发布,含 194 位贡献者的 582 个 PR,首日支持 2.8T 参数多模态模型 Kimi K3 和 MiniMax-H3 视频生成模型。
LMDeploy 发布 v0.15.0,新增 DeepSeek V4 支持,并支持长上下文与 MTP 前缀缓存命中。该版本为投机解码加入引导式解码支持,新增 AgRs all2all 后端与 memdecode 支持,同时优化 TTFT 并改进 Ascend-A3 多节点支持。
SGLang 发布 v0.5.16,包含 169 位贡献者的 574 个 PR。新投机解码算法 DSpark 在 DeepSeek-V4-Pro 上达到 383.7 tok/s,新增 975B 参数、1M token 上下文的 Inkling 多模态 MoE 模型支持。该版本还移除 QServe 与 FBGEMM FP8 量化路径,NVFP4 GEMM 现需 FlashInfer。
SGLang v0.5.15 发布,针对 Blackwell 调优的 GLM-5.2 NVFP4 在 8x B300 上实现 500+ tok/s/user、4x GB300 上 450 tok/s/user(bs=1)。
LMDeploy 发布 v0.14.0,新增 FP8 KV cache 量化、Qwen3 Omni 支持,并在 turbomind 后端支持 Qwen3.5(vit)推理。该版本还加入 OpenAI Responses 兼容端点和 /get_ppl 接口,并扩展 chat completions 支持 token-in/out 与返回 routed experts。
LMDeploy 发布 v0.14.0a2,新增 FP8 KV cache 量化、Qwen3 Omni 支持,并在 turbomind 后端支持 Qwen3.5(vit)推理。该版本还加入 OpenAI Responses 兼容端点,扩展 chat completions 与 v1/messages 的 token 输入输出并返回 routed experts。
LMDeploy 发布 v0.13.0,新增 Anthropic 兼容服务端点,并支持 TurboQuant(quant_policy=42)的 KV Cache 量化。