llama.cpp b11506:server 在 slot 保存/恢复时保留上下文检查点
llama.cpp 发布 b11506,server 在 slot 保存/恢复时保留上下文检查点,恢复后的 slot 可直接回滚到检查点,无需重新处理整个 prompt。
llama.cpp 发布 b11506,server 在 slot 保存/恢复时保留上下文检查点,恢复后的 slot 可直接回滚到检查点,无需重新处理整个 prompt。
llama.cpp 发布 b11516,修复 Hexagon 后端 IM2COL patch-embed 的 DMA ring 溢出问题。
联想 YOGA Pro 15 RTX Spark 于 10 月 8 日 9:00 开启全网盲约,是全球首批搭载 NVIDIA RTX Spark N1X 超级芯片的本地智能体 AIPC。
作者在《NBA 2K27》上体验 DLSS 5 正式版,球员面部、球衣织物、木地板和球场光影都更接近真实摄影机拍出的比赛质感。DLSS 5 采用 3D-Guided Neural Rendering,在图形管线后段用神经网络结合 RGB 画面、Motion Vectors、Temporal State 和开发者 Masks 做生成式渲染,单步模型推理只占一帧十几毫秒中的几毫秒。
Simon Willison 发布 ttok 1.0,将默认 tokenizer 从 GPT-4 切换为 GPT-5/GPT-6。
全球最大的独立 AI 原生影视公司 Utopai Studios 正在推进多部院线作品,包括预计 2027 年暑期上映的动画长片《The Most Serious Fart》,以及 8 集科幻剧集《Space Nation》和历史史诗电影《Cortés》。
Ollama v0.40.2 让旧版本下载的模型在首次运行时后台自动升级,以在 llama.cpp 上获得更好性能与兼容性,并保留原始副本作为备份以便安全降级。该版本还修复了 ollama list 对已升级模型重复显示的问题,ollama launch claude 现使用模型完整上下文长度。备份模型将在未来版本自动清除。
vLLM 发布 vllm-proto 0.5.0,该 tag 由提交者签名并通过验证。此次发布附带 2 个资源文件,版本号从 proto-v0.5.0 正式定为 vllm-proto 0.5.0。
llama.cpp 发布 b11515 版本,为 SYCL 后端加入 Q5_K 重排布局的 MMVQ 与融合 GLU 支持。该版本同步更新 macOS、Linux、Windows、Android 及 openEuler 等多平台构建产物,覆盖 CUDA 12/13、ROCm 10.0、Vulkan、OpenVINO、SYCL FP32/FP16 等后端。
Simon Willison 的 token 计数 CLI 工具 ttok 发布 0.4 版本,修复了 Click 警告、更新了 CI,并新增 --list-models 命令用于列出可用模型。该工具基于 OpenAI 开源的 tiktoken 库,可通过 uvx 直接运行,例如 `cat file.txt | uvx ttok` 即可统计 token 数。
Cornerstone OnDemand 基于 Amazon Bedrock 和 Strands Agents 构建多智能体系统 Orion AI,将数据库诊断时间从 45 分钟降至 10 分钟,减少 78%。该系统还把手动生命周期步骤从 10 步以上压缩为 1 次交互(减少 70%),并将冗余告警中位数削减 65%。三人团队用六个月完成交付。
openJiuwen 发布并开源企业级 AgentOS,将多智能体协同、自演进、算力亲和与企业级安全可靠能力整合进统一底座,并通过插件化架构连接上层应用与底层模型、算力资源。
微软在旧金山 Tech Week 活动上公布 Surface Laptop Ultra 的规格与价格,两个基础型号分别 2600 美元和 3700 美元起,最高配至 5900 美元。
TechCrunch Disrupt 2026 的 Smart Systems Stage 将举办一场题为“Where the AI Infrastructure Boom Is Creating Winners”的对谈。
Goodfire 发布一类监控工具,通过读取模型内部激活信号来发现 AI 智能体的风险行为,而非让另一个模型逐字审查输出,目前面向 Baseten 客户开放。
NVIDIA 开发者正用 GPT-6 Astra、Claude Fable 5 等前沿 AI 模型配合 Omniverse 库,通过自然语言指令构建仿真应用。
llama.cpp 发布 b11514 版本,修复了 Musa FWHT 问题(#30167)。该版本继续提供覆盖 macOS、Linux、Windows、Android 及 openEuler 的多平台构建,支持 CUDA 12/13、ROCm 10.0、Vulkan、SYCL、OpenVINO 等后端,其中 macOS Intel 与 openEuler 构建处于 DISABLED 状态。
Claude Code v2.1.295 为 command 和 HTTP hooks 新增 onFailure: "block",使无法启动、超时或异常退出的 hook 直接阻断操作;同时加入 Program Status Protocol(OSC 7501)支持,终端可显示 Claude Code 正在工作、等待用户还是已完成。
llama.cpp 发布 b11513,为 CUDA 后端改进 top-k 算法选择:按形状在 bitonic、radix select 与 DeviceTopK/CUB argsort 之间切换,阈值可在构建时覆盖。
OpenAI Codex 发布 0.162.0,在启用 worktree 功能后,可从受信任的本地项目创建和列出托管 Git worktree,并支持在智能体 Command Center 中用 p 键置顶任务。
Incarna 借助 Amazon Bedrock AgentCore payments,让智能体通过 x402 按次向 BlockRun 付费购买模型推理,将接入 x402 支付支持的工作量从数月缩短到数天并投入生产。
Claude Agent SDK 发布 v0.2.165,内置 Claude CLI 升级至 2.1.294,可通过 pip install claude-agent-sdk==0.2.165 安装。该版本还新增 CI 告警,当发布被阻塞或失败时会通知 Slack。
llama.cpp 发布 b11512,修复 DFlash 输出头共享问题,改为从 GGUF metadata 读取绑定输出权重,并共享绑定词嵌入 metadata,同时移除 DFlash 嵌入头回退逻辑。相关改动由 Codex 协助完成。
llama.cpp 发布 b11511 版本,修复了 CUDA 后端中 MMQ 的越界读取(out-of-bounds reads)问题(#29953)。该版本继续提供覆盖 macOS、Linux、Windows、Android 及 openEuler 的多平台构建,包括 CUDA 12.8/13.4、ROCm 10.0、Vulkan、SYCL、OpenVINO 等后端。
llama.cpp 发布 b11510,CUDA 后端新增循环 PAD kernel,可处理超过 65535 行或切片的场景。该版本同步更新 macOS/iOS、Linux、Android、Windows 及 openEuler 等多平台构建,涵盖 CUDA 12.8/13.4、ROCm 10.0、Vulkan、SYCL、OpenVINO 等后端。
Amazon SageMaker HyperPod 多租户参考架构通过 AWS IAM Identity Center 统一认证、按团队划分 SageMaker AI 域、Kubernetes 命名空间隔离工作负载,并用 HyperPod Task Governance 实现算力配额与调度优先级管理。
Unsloth 发布 v0.1.905-beta,可用 QLoRA 把任意文本或视觉 LLM 训练成 Jev 风格决策模型,决策准确率从 30% 提升到 80%。
推荐理由:Unsloth 把决策模型训练、测试、导出到部署串成一条链路,并给出准确率从 30% 到 80% 的对照。
Ollama v0.40.2-rc0 在列表输出中隐藏了重复与降级保护条目。加载需要 llama.cpp 补丁集的旧版 GGUF 时,Ollama 会在磁盘上做惰性转换,并临时保留新旧两份 GGUF、创建影子 v1 manifest 标签,以防降级后的服务器删除新 blob。这些旧副本将在未来版本中移除以回收磁盘空间。
llama.cpp 发布 b11509,修复 CUDA 后端 CCCL 版本守卫在 4.x 上误判的问题:旧逻辑分别比较主次版本号,导致 CCCL 4.x 下 STRIDED_ITERATOR_AVAILABLE 未定义,argsort 静默回退到 init_offsets 路径,仅损失性能而不报错。
llama.cpp 发布 b11507 版本,新增 MoE 缓存跨多 GPU 支持(#30112)。该版本继续提供 macOS、Linux、Windows、Android 及 openEuler 等多平台构建,覆盖 CUDA 12/13、ROCm 10.0、Vulkan、SYCL、OpenVINO 等后端。
安全公司 Zenity Labs 发现 AWS Bedrock AgentCore 存在名为 AgentCorruption 的漏洞链,攻击者只需对一个公开智能体的聊天访问权限,用一条提示词就能接管同一 AWS 账户和区域内所有 AgentCore 智能体,读取私密对话、源代码和存储的凭证。
《Gears of War: E-Day》已于 10 月 6 日全球发售后上线 GeForce NOW,Ultimate 会员可以 GeForce RTX 5080 级性能云端游玩,并支持 NVIDIA DLSS 和 NVIDIA Reflex。
正行创新在APRCE 2026发布面向零售开放场景的Physical AI解决方案,由双足人形机器人H1、搬运理货轮臂式机器人C1及机器人管理平台M1组成,支持“0改造”快速部署,机器人可实现99%任务自主完成。自研轻量级世界动作模型SLM-0.5在LIBERO基准测试中平均任务成功率98.6%,推理速度较主流方案提升24倍。方案计划2027年正式商业化,支持直接采购或RaaS订阅。
JetBrains 发布 Mellum2.1,这是其 6 月开源的 12B MoE 模型的新版本,架构不变,仍为 2.5B 激活参数、Apache 2.0 许可。
推荐理由:JetBrains 开源编码智能体模型 Mellum2.1,读者可了解其 RL 后训练路线与自托管部署方式。
LegalOn 将 Codex 每日预估成本降低 65%,同时保持开发速度。其做法是按任务匹配 Astra、Sol 和 Luna,并对预算进行策略性管理。
Nvidia 正大力押注物理 AI,其全栈安全解决方案已被多家机器人公司采用,目标指向更安全的 Robotaxi 与人形机器人。
AVEVA 首席技术官 Arti Garg 提出,工业 AI 正从预测分析转向基础模型、physical AI 与 agentic AI,但因其直接作用于物理系统,负责任部署成为关键。AVEVA 的负责任 AI 框架强调安全、效率与人类监督,主张 AI 应增强而非取代关键决策中的人。Garg 还参与 IEEE 工作组,制定覆盖电力、能源、水资源与碳的 AI 环境影响测量标准。
微软在特别发布会上推出 Surface Laptop Ultra,搭载 NVIDIA RTX Spark Superchip,最高 128GB 统一内存,可在本地运行超过 1200 亿参数模型,起价 2599 美元,10 月 7 日开放预订、10 月 16 日发货。
推荐理由:微软把 Windows 的 AI 能力从 Copilot 入口扩展到本地模型、Agent 容器与算力调度,读者可据此判断 AI PC 的硬件与系统路线变化。
Cline Desktop v0.0.45 修复了自 0.0.38 起 SSH 环境连接报 SyntaxError 的问题,并新增 Claude Haiku 5.5 模型。Google Vertex AI、GitHub Copilot 等多个提供商的默认模型改为 Claude Haiku 5.5,同时修复了 GPT-6 Astra、Claude Opus 5.5 等模型关闭推理时的 400 错误。
Cline CLI v3.0.70 修复了在 GPT-6 Astra、GPT-6.1 Sol、Claude Fable 5 和 Claude Opus 5.5 上关闭推理时生成 commit message 和任务报 400 错误的问题,并解决了 MCP server 或 hook 退出后约 3 秒即退出的缺陷。