Google 用 Tunix 在 TPU 上实现自主 LLM 后训练
Google 发布 autofinetune 项目,把自主研究循环用于 LLM 后训练,基于 Tunix、Gemma 和 Cloud TPU,由 Antigravity CLI 与 Gemini Flash 3.7 编排。
推荐理由:原文给出自主后训练循环的完整配置与两个真实案例,可据此迁移到自己的微调流程。
技术方向
把模型训好、跑起来、跑得便宜:LLaMA-Factory、Unsloth、Axolotl、TRL、PEFT 的微调方法,DeepSpeed 的训练与并行,vLLM、SGLang、llama.cpp、Ollama、TensorRT-LLM、LMDeploy 的推理与部署,以及量化、显存与成本优化。
55 条精选近 30 天 42 条共收录 272 条
Google 发布 autofinetune 项目,把自主研究循环用于 LLM 后训练,基于 Tunix、Gemma 和 Cloud TPU,由 Antigravity CLI 与 Gemini Flash 3.7 编排。
推荐理由:原文给出自主后训练循环的完整配置与两个真实案例,可据此迁移到自己的微调流程。
Cursor 发布 Projects 功能,用于承接功能开发、迁移或完整应用等更大规模的工作,可跨数月保持上下文、把任务分派给数千个子智能体,并在无需提示的情况下执行周期性工作。
推荐理由:原文说明了协调者智能体如何拆分任务、共享上下文并常驻云端,可据此判断长周期开发工作流的组织方式。
Google DeepMind 发布 AlphaGenome Atlas,一个包含人类基因组 90 亿个单核苷酸变异效应预测的平台,规模达 1PB,超过 AlphaFold Database 的 30 倍,今日起通过网站门户、AlphaGenome API 和 Google Antigravity 中的 skill 向学术研究免费开放。
推荐理由:AlphaGenome Atlas 把 90 亿个单碱基变异的预测结果做成可检索资源,读者可了解基因组变异解读的规模化路径。
Cursor 上线 self-hosted machines,让工具执行完全留在用户自己的网络内,代码库、构建产物和密钥都保存在自有基础设施的机器上,由智能体在本地处理工具调用。
推荐理由:Cursor 把智能体的工具执行放进企业自有网络,读者可据此判断代码与密钥不出内网的落地方式。
Google Cloud 将原生 TPU 支持集成进 vLLM,并以 Qwen3-Embedding-8B 和 Qwen3-VL-Embedding-8B 为目标模型做了多项工程优化,支持 4K+ token 文本和 15K+ token 多模态输入。
推荐理由:原文给出 vLLM-TPU 上部署 Qwen3 嵌入模型的具体优化与开源配方,可了解长上下文多模态嵌入的工程路径。
Mistral 发布 Agentic Search,一个让模型在多步检索循环中查找、检查和验证信息的检索层,通过 Mistral Search Toolkit 提供,并内置于 Studio 和 Vibe 的 Libraries。
推荐理由:原文给出多步检索循环在 FinanceBench 与 OfficeQA Pro 上的准确率、token 与延迟变化,可据此判断传统 one-shot RAG 的边界。
Cursor 发布云智能体与 Cursor harness 更新,让常驻智能体可自动响应事件、保持目标并完成长会话任务。新增 Subscriptions 让云智能体监控 PR、Slack 线程或定时任务,并自动订阅自己创建的 PR 直至完成;子智能体可运行在各自独立的虚拟机环境中。此外还加入 Custom Modes、/goal 长周期目标指令,以及不打断智能体的 Steering 改进。
推荐理由:官方更新列出云智能体的订阅、目标保持与子智能体独立环境等能力,可据此判断常驻智能体工作流的变化。
Cursor 上线 Origin 代码托管,今日起面向所有付费方案开放早期 beta,企业组织管理员可选择退出。首批功能包括仓库、Pull Request、代码浏览和 GitHub 同步,Origin 托管的仓库以 Origin 为唯一来源,同步的 GitHub 仓库仍以 GitHub 为准,PR 评论双向同步。
推荐理由:Cursor 把代码托管、PR 与智能体放进同一入口,读者可据此判断它与 GitHub 的分工边界。
Cursor 为 Cloud Agents 推出 Builds 功能,在后台预先准备已克隆仓库、装好依赖并跑完安装脚本的环境副本,智能体直接启动而无需每次从零配置,该功能不额外收费。
推荐理由:原文给出 Cloud Agents 环境预构建的机制与启动提速数据,可据此判断智能体启动流程的改动方式。
Zed 团队发布 Delta,一个面向智能体编码与代码审阅的多人协作环境,首批用户已进入私测。Delta 基于自研 DeltaDB,将对话与 worktree 实时同步,兼容现有 git 仓库,评论可锚定到任意代码行并随代码演进;DeltaDB 还支持云端运行,关闭笔记本后智能体继续工作,并可通过链接在浏览器打开。
推荐理由:Zed 团队把 DeltaDB 的实时同步能力做成独立应用,读者可了解多人协作写代码与审阅智能体产出的新形态。
Zed 在 1.14 版本起为智能体面板的终端和 fetch 工具默认启用沙箱,由操作系统强制执行,默认禁止在项目目录外写入、写入 .git 以及发起网络请求,智能体需要时可申请临时提权并说明理由。
推荐理由:Zed 官方说明智能体沙箱的默认规则、权限升级流程与实现方式,并给出沙箱边界之外的攻击面清单。
JetBrains 在 2026 上半年 AI 开发支出增长约 10 倍后,把内部调试用的 CLI 包装器做成 JetBrains Central CLI,并于 7 月 8 日开放早期访问,任何拥有 JetBrains AI credits 的个人或组织均可使用。
推荐理由:JetBrains 公开了内部 AI 成本治理的完整路径,从失控到自研 CLI 再到开放早期访问,可对照自身团队的多工具开销问题。
Berkeley AI Research 与 IBM Research 将 K-Search 进化式内核搜索框架扩展到 MLX,通过结构化 CUDA-to-MLX 翻译层把已有 CUDA 内核经验迁移到 Apple Silicon。
推荐理由:展示了把 CUDA 内核优化经验结构化迁移到 Apple Silicon 的方法,并给出注意力与 Mamba 两类内核的实测对比。
JetBrains Air 新版本通过 JetBrains 与 Zed 开发的 Agent Client Protocol(ACP)接入 GitHub Copilot、OpenCode、Pi、Cline 等兼容智能体,此前该工作流仅限 Air 自带的 Claude、Codex、Gemini CLI 和 Junie。
推荐理由:Air 通过 ACP 接入多家编码智能体并支持本地模型,读者可据此判断企业既有工具能否纳入同一工作流。
JetBrains 发布 JetBrains Context,一个为编码智能体构建语义索引并提供语义检索的仓库智能层,已随 JetBrains AI 订阅开放早期访问且不额外收费。
推荐理由:官方给出 JetBrains Context 的索引机制、接入方式与三项基准上的耗时成本降幅,可据此判断编码智能体的上下文方案。