跳到正文

技术方向

微调与部署 最新动态

把模型训好、跑起来、跑得便宜:LLaMA-Factory、Unsloth、Axolotl、TRL、PEFT 的微调方法,DeepSpeed 的训练与并行,vLLM、SGLang、llama.cpp、Ollama、TensorRT-LLM、LMDeploy 的推理与部署,以及量化、显存与成本优化。

50 条精选近 30 天 38 条共收录 258 条

更新

微调与部署的精选

今天10月9日周五第 1–20 条
10月8日周四
  1. 爱范儿78

    微软发布 Surface Laptop Ultra 与混合智能 Windows 更新

    微软在特别发布会上推出 Surface Laptop Ultra,搭载 NVIDIA RTX Spark Superchip,最高 128GB 统一内存,可在本地运行超过 1200 亿参数模型,起价 2599 美元,10 月 7 日开放预订、10 月 16 日发货。

    推荐理由:微软把 Windows 的 AI 能力从 Copilot 入口扩展到本地模型、Agent 容器与算力调度,读者可据此判断 AI PC 的硬件与系统路线变化。

  2. 爱范儿78

    微软与英伟达发布 RTX Spark 及 Surface Laptop Ultra

    微软在 Windows 与 Surface 特别活动上联合英伟达发布 RTX Spark 计算平台,这是一块集成 CPU、GPU 和最高 128GB 统一内存的 ARM 架构 SoC,最高提供 1 PFLOP FP4 AI 算力,可本地运行 1250 亿参数模型。

    推荐理由:梳理了微软与英伟达联合发布的新架构与硬件细节,可了解本地 Agent 算力路线的具体落地方式。

  3. Google Developers Blog75

    Google 开源端侧 GPU 推理引擎 ML Drift

    Google AI Edge 团队以 Apache 2.0 协议开源端侧 GPU 计算引擎 ML Drift,它抽象 OpenGL ES、OpenCL、Metal 和 WebGPU,作为 LiteRT 的核心 GPU 加速引擎,也可独立使用。

    推荐理由:Google 开源端侧 GPU 推理引擎 ML Drift,并给出 Chrome、YouTube Shorts、Adobe 等迁移后的实测提速数据。

  4. Google Developers Blog71

    Google 发布 AQuA 环境质量智能体,诊断生产环境智能体故障

    Google 发布 AQuA(Ambient Quality Agent),一个在 Google Cloud 项目内旁路运行的质量智能体,按计划、部署后或按需扫描 Cloud Trace、Cloud Logging 或 BigQuery 中的生产轨迹,经采样、评审、聚类、验证、跟踪五阶段流水线输出可验证的故障洞察。

    推荐理由:原文给出 AQuA 的五阶段流水线、成本数据和一次真实多智能体排查案例,可据此判断生产环境智能体质量监控的可行做法。

  5. Hugging Face Blog76

    作者用 ML Intern 两天自建六个模型,总花费约 103 美元

    作者在 HuggingChat 中开启 ML-intern 模式,用提示词让它完成数据集构建、训练、评测和发布,两天内做出六个模型,总计算花费约 103 美元。

    推荐理由:作者用 ML Intern 在两天内从零训练并发布六个模型,给出了提示词写法与逐项算力花费,可迁移到自己的训练流程。

  6. Google Research62

    Google Research 研究:AI 辅助提升专利撰写产出,但未必加速初级律师成长

    Google Research 在 NBER 发布一项为期三个月的专利撰写实地实验,将当时未发布的 Google Labs AI 专利写作助手(现属 Gemini Notebook)随机开放给 11 家知识产权律所的 133 名律师,其中三分之二获得早期访问权。

    推荐理由:三个月专利撰写实验区分了 AI 带来的即时产出提升与无辅助判断力的变化,为理解 AI 对专业能力的影响提供了实证。

  7. GitHub Copilot Changelog60

    Claude Haiku 5.5 在 GitHub Copilot 正式可用

    Anthropic 最新的轻量模型 Claude Haiku 5.5 已在 GitHub Copilot 正式可用,面向 subagents、快速编辑和终端任务等高频场景。

    推荐理由:读者可以了解 Claude Haiku 5.5 在 GitHub Copilot 中的可用范围与计费方式,以及它在编码任务上的初步表现。

  8. NVIDIA Blog76

    NVIDIA 与 Microsoft 发布 RTX Spark 笔记本和 Windows 智能体基础设施

    在旧金山举行的 Windows AI and Surface 活动上,NVIDIA 与 Microsoft 宣布为 Windows PC 上的 AI 智能体共同设计软硬件,并公布 RTX Spark 笔记本即日开启预售、10 月 16 日开售,紧凑型台式机 11 月上市。

    推荐理由:英伟达与微软把智能体运行所需的系统级容器和本地算力硬件一起端出,读者可据此判断本地智能体落地的软硬件门槛。

  9. GitHub Blog · AI & ML62

    GitHub 推出基于 ModernBERT 的密钥检测模型,扩展 push protection

    GitHub 发布与 Microsoft Applied Sciences 联合微调的 ModernBERT 分类器,把 push protection 扩展到无固定格式的密钥,可在 2 毫秒内评估一批候选密钥,据称能把可拦截的密钥数量提升一倍以上。

    推荐理由:GitHub 用九个季度数据说明密钥泄露与人工修复的失衡,并给出把检测前移到 push 环节的模型方案。

  10. GitHub Copilot Changelog60

    GitHub 推出专用模型检测泄露密钥

    GitHub 公布专用于密钥检测的微调模型,可读取上下文代码识别凭据,包括没有固定 token 格式的密码,且不生成代码或文本。该模型已自动升级现有 AI 检测密码告警,AI 推送保护进入私有预览,Copilot CLI 与 Copilot App 的 /security-review 命令也将加入密钥分类器检查。

    推荐理由:GitHub 把微调后的密钥检测模型接入告警、推送保护和 Copilot 安全审查,可据此了解各功能的开放范围与计费方式。

  11. Microsoft Research71

    微软开源 Agent Lightning v1.0:3500 行代码的轻量智能体 RL 框架

    微软研究院开源 Agent Lightning v1.0,一个约 3500 行代码的轻量智能体强化学习框架,提出 Harnessed Agentic RL 范式,让部署时使用的同一套 agent harness 直接参与训练,无需在训练框架内重新实现智能体。

    推荐理由:微软开源 Agent Lightning v1.0,用约 3500 行代码把真实 harness 直接接入 RL 训练,并给出 6000 样本的编码智能体训练结果。

10月7日周三
  1. GitHub Copilot Changelog67

    GitHub Copilot 本地沙箱正式可用

    GitHub Copilot 的本地沙箱功能正式可用,覆盖 GitHub Copilot CLI、GitHub Copilot 应用以及使用 Agent Host 的 VS Code 会话。

    推荐理由:官方说明本地沙箱在 CLI、应用与 VS Code 中正式可用,读者可据此了解智能体工作流的权限边界如何落地。

  2. Ollama Releases62

    Ollama v0.40.0 发布:Apple Silicon 上模型默认改用 MLX 运行

    Ollama 发布 v0.40.0,在 Apple Silicon 设备上,MLX 运行时支持的模型架构将自动改用 MLX 运行。此次支持的模型包括 qwen3.8、gemma4、qwen3.6 和 qwen3.5,决策模型 Nimble、tev1、clef、clef-flash 也已上线 MLX,嵌入模型 embeddinggemma-2 同样获得 MLX 支持。

    推荐理由:Ollama 在 Apple Silicon 上默认切换到 MLX 运行时,读者可据此了解本地部署的默认行为变化与已支持模型范围。

  3. Unsloth Releases60

    Unsloth 发布 v0.1.903-beta:内置浏览器、EmbeddingGemma 2 与语音克隆

    Unsloth 发布 v0.1.903-beta,在聊天旁加入内置浏览器面板,文件、网页和模型生成的 HTML 都以标签页打开,并支持对页面内容提问。该版本同时支持 Google DeepMind 的多模态嵌入模型 EmbeddingGemma 2,提供 740M 参数版本(纯文本 270M)、100+ 语言和 8K 上下文窗口,代码任务比上一代提升约 14%。

    推荐理由:Unsloth 一次更新同时加入内置浏览器、EmbeddingGemma 2 支持与语音克隆页面,可据此判断本地微调工具链的边界扩展。