跳到正文

技术方向

微调与部署 最新动态

把模型训好、跑起来、跑得便宜:LLaMA-Factory、Unsloth、Axolotl、TRL、PEFT 的微调方法,DeepSpeed 的训练与并行,vLLM、SGLang、llama.cpp、Ollama、TensorRT-LLM、LMDeploy 的推理与部署,以及量化、显存与成本优化。

55 条精选近 30 天 42 条共收录 272 条

更新

精选归档 · 第 3 页

9月11日周五第 41–55 条
9月10日周四
  1. Cursor Changelog85

    Cursor 推出 Projects,用协调者智能体管理长期开发任务

    Cursor 发布 Projects 功能,用于承接功能开发、迁移或完整应用等更大规模的工作,可跨数月保持上下文、把任务分派给数千个子智能体,并在无需提示的情况下执行周期性工作。

    推荐理由:原文说明了协调者智能体如何拆分任务、共享上下文并常驻云端,可据此判断长周期开发工作流的组织方式。

9月8日周二
  1. Google DeepMind74

    Google DeepMind 发布 AlphaGenome Atlas,覆盖人类基因组 90 亿个单碱基变异预测

    Google DeepMind 发布 AlphaGenome Atlas,一个包含人类基因组 90 亿个单核苷酸变异效应预测的平台,规模达 1PB,超过 AlphaFold Database 的 30 倍,今日起通过网站门户、AlphaGenome API 和 Google Antigravity 中的 skill 向学术研究免费开放。

    推荐理由:AlphaGenome Atlas 把 90 亿个单碱基变异的预测结果做成可检索资源,读者可了解基因组变异解读的规模化路径。

9月2日周三
  1. Cursor Changelog74

    Cursor 推出自托管机器,工具执行留在自有网络

    Cursor 上线 self-hosted machines,让工具执行完全留在用户自己的网络内,代码库、构建产物和密钥都保存在自有基础设施的机器上,由智能体在本地处理工具调用。

    推荐理由:Cursor 把智能体的工具执行放进企业自有网络,读者可据此判断代码与密钥不出内网的落地方式。

8月26日周三
  1. Google Developers Blog60

    Google Cloud 在 TPU 上为 vLLM 加入长上下文多模态嵌入推理支持

    Google Cloud 将原生 TPU 支持集成进 vLLM,并以 Qwen3-Embedding-8B 和 Qwen3-VL-Embedding-8B 为目标模型做了多项工程优化,支持 4K+ token 文本和 15K+ token 多模态输入。

    推荐理由:原文给出 vLLM-TPU 上部署 Qwen3 嵌入模型的具体优化与开源配方,可了解长上下文多模态嵌入的工程路径。

8月20日周四
  1. Mistral AI71

    Mistral 发布 Agentic Search 检索层,FinanceBench 准确率提升至 86%

    Mistral 发布 Agentic Search,一个让模型在多步检索循环中查找、检查和验证信息的检索层,通过 Mistral Search Toolkit 提供,并内置于 Studio 和 Vibe 的 Libraries。

    推荐理由:原文给出多步检索循环在 FinanceBench 与 OfficeQA Pro 上的准确率、token 与延迟变化,可据此判断传统 one-shot RAG 的边界。

8月19日周三
  1. Cursor Changelog73

    Cursor 更新云智能体与 Harness,新增订阅、/goal 与独立子智能体环境

    Cursor 发布云智能体与 Cursor harness 更新,让常驻智能体可自动响应事件、保持目标并完成长会话任务。新增 Subscriptions 让云智能体监控 PR、Slack 线程或定时任务,并自动订阅自己创建的 PR 直至完成;子智能体可运行在各自独立的虚拟机环境中。此外还加入 Custom Modes、/goal 长周期目标指令,以及不打断智能体的 Steering 改进。

    推荐理由:官方更新列出云智能体的订阅、目标保持与子智能体独立环境等能力,可据此判断常驻智能体工作流的变化。

8月17日周一
  1. Cursor Changelog71

    Cursor 推出 Origin 代码托管,进入早期 beta

    Cursor 上线 Origin 代码托管,今日起面向所有付费方案开放早期 beta,企业组织管理员可选择退出。首批功能包括仓库、Pull Request、代码浏览和 GitHub 同步,Origin 托管的仓库以 Origin 为唯一来源,同步的 GitHub 仓库仍以 GitHub 为准,PR 评论双向同步。

    推荐理由:Cursor 把代码托管、PR 与智能体放进同一入口,读者可据此判断它与 GitHub 的分工边界。

8月13日周四
  1. Cursor Changelog60

    Cursor Cloud Agents 推出 Builds,启动速度提升 3 倍

    Cursor 为 Cloud Agents 推出 Builds 功能,在后台预先准备已克隆仓库、装好依赖并跑完安装脚本的环境副本,智能体直接启动而无需每次从零配置,该功能不额外收费。

    推荐理由:原文给出 Cloud Agents 环境预构建的机制与启动提速数据,可据此判断智能体启动流程的改动方式。

8月12日周三
  1. Zed Blog60

    Zed 团队推出多人协作编码环境 Delta 并开启私测

    Zed 团队发布 Delta,一个面向智能体编码与代码审阅的多人协作环境,首批用户已进入私测。Delta 基于自研 DeltaDB,将对话与 worktree 实时同步,兼容现有 git 仓库,评论可锚定到任意代码行并随代码演进;DeltaDB 还支持云端运行,关闭笔记本后智能体继续工作,并可通过链接在浏览器打开。

    推荐理由:Zed 团队把 DeltaDB 的实时同步能力做成独立应用,读者可了解多人协作写代码与审阅智能体产出的新形态。

8月5日周三
  1. Zed Blog62

    Zed 为智能体面板加入默认沙箱

    Zed 在 1.14 版本起为智能体面板的终端和 fetch 工具默认启用沙箱,由操作系统强制执行,默认禁止在项目目录外写入、写入 .git 以及发起网络请求,智能体需要时可申请临时提权并说明理由。

    推荐理由:Zed 官方说明智能体沙箱的默认规则、权限升级流程与实现方式,并给出沙箱边界之外的攻击面清单。

8月3日周一
  1. JetBrains AI Blog60

    JetBrains 开放 Central CLI 早期访问,用 AI credits 管控第三方 Agent 开销

    JetBrains 在 2026 上半年 AI 开发支出增长约 10 倍后,把内部调试用的 CLI 包装器做成 JetBrains Central CLI,并于 7 月 8 日开放早期访问,任何拥有 JetBrains AI credits 的个人或组织均可使用。

    推荐理由:JetBrains 公开了内部 AI 成本治理的完整路径,从失控到自研 CLI 再到开放早期访问,可对照自身团队的多工具开销问题。

7月29日周三
  1. Berkeley AI Research62

    从 CUDA 到 MLX:K-Search 如何把内核优化经验带到 Apple Silicon

    Berkeley AI Research 与 IBM Research 将 K-Search 进化式内核搜索框架扩展到 MLX,通过结构化 CUDA-to-MLX 翻译层把已有 CUDA 内核经验迁移到 Apple Silicon。

    推荐理由:展示了把 CUDA 内核优化经验结构化迁移到 Apple Silicon 的方法,并给出注意力与 Mamba 两类内核的实测对比。

7月22日周三
  1. JetBrains AI Blog62

    JetBrains Air 更新:接入更多智能体、本地模型与 Java/Kotlin 代码智能

    JetBrains Air 新版本通过 JetBrains 与 Zed 开发的 Agent Client Protocol(ACP)接入 GitHub Copilot、OpenCode、Pi、Cline 等兼容智能体,此前该工作流仅限 Air 自带的 Claude、Codex、Gemini CLI 和 Junie。

    推荐理由:Air 通过 ACP 接入多家编码智能体并支持本地模型,读者可据此判断企业既有工具能否纳入同一工作流。

7月21日周二
  1. JetBrains AI Blog71

    JetBrains 发布 JetBrains Context,为编码智能体提供仓库智能层

    JetBrains 发布 JetBrains Context,一个为编码智能体构建语义索引并提供语义检索的仓库智能层,已随 JetBrains AI 订阅开放早期访问且不额外收费。

    推荐理由:官方给出 JetBrains Context 的索引机制、接入方式与三项基准上的耗时成本降幅,可据此判断编码智能体的上下文方案。