Anthropic 为 Claude 推出 Dashboards 和 Motion 两项测试功能
Anthropic 为 Claude 推出两项 beta 功能:Dashboards 可连接 BigQuery、Databricks、Snowflake、Salesforce 等数据源。
Anthropic 为 Claude 推出两项 beta 功能:Dashboards 可连接 BigQuery、Databricks、Snowflake、Salesforce 等数据源。
Unsloth 发布 v0.1.904-beta,支持用 QLoRA 将任意文本或视觉 LLM 训练成 Jev 风格决策模型,决策准确率从 30% 提升到 80%,并可在 Unsloth 内完成训练、测试、导出与部署。
微软研究院开源 Agent Lightning v1.0,一个约 3500 行代码的轻量智能体强化学习框架,提出 Harnessed Agentic RL 范式,让部署时使用的同一套 agent harness 直接参与训练,无需在训练框架内重新实现智能体。
推荐理由:微软开源 Agent Lightning v1.0,用约 3500 行代码把真实 harness 直接接入 RL 训练,并给出 6000 样本的编码智能体训练结果。
TRL 发布 v1.14.2 补丁,修复两处静默训练错误和三处崩溃。其中 #7505 影响默认生成路径(use_vllm=False)下的 GRPO、RLOO 和 Distillation。
Unsloth Desktop 新增 Cmd/Ctrl+P 命令面板,支持分享 GGUF 运行设置,并让 Laya 决策模型短请求提速最高 4.1 倍。
Google DeepMind 发布 SynthID Bio,将水印技术引入合成生物学,把不可感知的签名直接嵌入生物代码,使水印不仅能在数字模型上验证,也能在合成出的实体蛋白质上验证,同时保持其生物功能。
推荐理由:SynthID 水印从图像扩展到合成生物,读者可了解其在 DNA 合成筛查与数据库标注上的验证思路。
Axolotl v0.20.0 发布,自 v0.19.0 以来累计 67 个 commit,新增 GGUF 导出、Ringmaster 上下文并行、原生 NVFP4 LoRA 和无 DeepEP 的专家并行。
联合国系统发布 UN System Data Commons,这是一个基于 Google Data Commons 构建的开源平台,把分散的全球统计数据整合为可搜索的 AI-ready 知识图谱。
推荐理由:联合国系统与 Google 合作把分散的全球统计数据整合为可自然语言查询、可被 AI 智能体调用的知识图谱。
PEFT 发布 v0.21.0,新增 Riemannian 预条件 LoRA 优化器、LoRA 变体 KaSA、Super-Tuning 和 ShadowPEFT 四种方法。
Axolotl v0.19.0 发布,新增声明式模型支持系统,并支持 Qwen3.8-Flash-Next、Ling 3.0、Muse Glimmer 30B 等七个模型家族及三元(BitNet b1.58)QAT。
TRL v1.13.0 新增 1M token 长上下文训练支持,在单台 8×H100 节点上以 Qwen3-8B 实测 1,048,576 token、380 秒/步、每 GPU 56.2 GB(bf16)。
Google DeepMind 发布 AlphaGenome Atlas,一个包含人类基因组 90 亿个单核苷酸变异效应预测的平台,规模达 1PB,超过 AlphaFold Database 的 30 倍,今日起通过网站门户、AlphaGenome API 和 Google Antigravity 中的 skill 向学术研究免费开放。
推荐理由:AlphaGenome Atlas 把 90 亿个单碱基变异的预测结果做成可检索资源,读者可了解基因组变异解读的规模化路径。
TensorRT-LLM v1.3.0rc25 将 KV cache manager V2 设为 DeepSeek V3/R1/V3 Lite、DeepSeek V3.2/V4。
TRL v1.11.0 发布,其 vllm-serve 不再自建 FastAPI 服务,改为转发到 vLLM 原生 server,脚本从 1218 行降至约 130 行,权重同步改用 vLLM 的 NCCL weight-transfer 引擎。
TRL v1.10.0 将 DistillationTrainer 和 DistillationConfig 从 trl.experimental.distillation 升级为顶层稳定 API,导入方式与 SFT / DPO / GRPO / KTO 一致,旧路径仍可用但会发出 FutureWarning(v2.0.0 移除)。
PEFT 发布 v0.20.0,一次性新增 HiRA、GLoRA、BEFT、MonteCLoRA、VeLoRA、Uni-LoRA、FRoD、MiCA、DEFT 九种参数高效微调方法,并新增面向图像生成方法的对比基准。
Axolotl v0.18.0 发布,自 v0.17.0 以来累计超 90 次提交,主打低成本微调超大规模稀疏 MoE 模型。新增 NVFP4 MoE-LoRA,在 ScatterMoE 与 SonicMoE 后端支持 4-bit 专家 LoRA/QLoRA,4k 至 32k 上下文下显存占用近乎持平,并支持 GLM-5.2(DSA)2D 专家并行微调。
Axolotl v0.17.0 发布,新增基于 DeepEP 的 MoE 专家并行(EP)训练、BitNet 1.58-bit 全量微调,以及通过 Tinker 兼容 API 的远程训练。
LLaMA-Factory 发布 v0.9.5,新增对 Qwen3.5/Qwen3.6、Gemma 4 模型的主要支持,并兼容 Transformers v5。
PEFT 发布 v0.19.0,一次性新增 GraLoRA、BD-LoRA、Cartridges、PVeRA、PSOFT、Lily、PEANuT、TinyLoRA、AdaMSS 共 9 种 PEFT 方法。
Axolotl 发布 v0.16.1,新增对 Gemma 4 的支持,并附带示例 YAML 配置。该版本自 v0.16.0 以来共合并 356 个提交,完整变更可通过 v0.16.0...v0.16.1 对比查看。
Axolotl 发布 v0.16.0,新增异步 GRPO 强化学习训练,集成 vLLM 并支持 LoRA 权重同步与 FP8,在 Qwen2-0.5B 上步时从 3.79s 降至 1.59s,提速 58%。
Axolotl 发布 v0.15.0,新增 GLM、Qwen3.5 及 Qwen3.5 MoE 模型支持,并引入 SonicMoE 内核与 ScatterMoE LoRA。
Axolotl 发布 v0.14.0,将底层 transformers 依赖从 v4 升级到 v5,并新增 MoE 内核选择(batched_mm、grouped_mm)及 scattermoe 自定义集成,显著提升 MoE 模型训练速度并降低显存占用。
LlamaFactory 发布 v0.9.4,仓库名从 LLaMA-Factory 改为 LlamaFactory,弃用 Python 3.9–3.10、要求 3.11–3.13,并从 pip 迁移到 uv 安装。
PEFT 发布 0.18.0,新增 RoAd、ALoRA、Arrow、WaveFT、DeLoRA、OSF 六种微调方法。RoAd 通过逐元素乘法学习 2D 旋转矩阵,是除 LoRA 外唯一支持混合 adapter 批次的 PEFT 方法;ALoRA 可按 token 序列选择性启用 LoRA 并复用 KV cache。