Axolotl v0.19.0 发布:新增 Qwen3.8-Flash-Next 等七个模型家族与三元 QAT
Axolotl v0.19.0 发布,新增声明式模型支持系统,并支持 Qwen3.8-Flash-Next、Ling 3.0、Muse Glimmer 30B 等七个模型家族及三元(BitNet b1.58)QAT。
Axolotl v0.19.0 发布,新增声明式模型支持系统,并支持 Qwen3.8-Flash-Next、Ling 3.0、Muse Glimmer 30B 等七个模型家族及三元(BitNet b1.58)QAT。
TRL v1.13.0 新增 1M token 长上下文训练支持,在单台 8×H100 节点上以 Qwen3-8B 实测 1,048,576 token、380 秒/步、每 GPU 56.2 GB(bf16)。
Google DeepMind 发布 AlphaGenome Atlas,一个包含人类基因组 90 亿个单核苷酸变异效应预测的平台,规模达 1PB,超过 AlphaFold Database 的 30 倍,今日起通过网站门户、AlphaGenome API 和 Google Antigravity 中的 skill 向学术研究免费开放。
推荐理由:AlphaGenome Atlas 把 90 亿个单碱基变异的预测结果做成可检索资源,读者可了解基因组变异解读的规模化路径。
微软研究院发布 GigaPath-Flash 和 GigaTIME-Flash,以蒸馏自十亿参数 GigaPath 编码器的 22M 参数 ViT-S 骨干替代原模型,在 PANDA 前列腺分级和 EBRAINS 脑肿瘤分型基准上以约 50 倍更少算力达到原 GigaPath 3% 以内的性能。
TensorRT-LLM v1.3.0rc25 将 KV cache manager V2 设为 DeepSeek V3/R1/V3 Lite、DeepSeek V3.2/V4。
TRL v1.11.0 发布,其 vllm-serve 不再自建 FastAPI 服务,改为转发到 vLLM 原生 server,脚本从 1218 行降至约 130 行,权重同步改用 vLLM 的 NCCL weight-transfer 引擎。
METR 研究显示 AI 对科学的加速并不均衡:2026 年网络安全漏洞报告速度较 2025 年大幅加快,数学领域贡献有限,AI 研究本身尚无显著加速。多校团队提出 SPADE 框架,通过自博弈让 LLM 交替生成可执行训练环境并求解,在 Qwen3-30B-A3B 上游戏环境套件均分达 58.3,较基线提升 8.1。
Import AI 第 469 期介绍了新基准 DiG-bench,用 70 款规则与目标均隐藏的游戏测试 AI 的探索与发现能力,21 款已公开,Opus 5 与 Fable 5 配合 Claude Code 表现最佳,仅二者能在 Tier 7 通关 0.2 的任务。
TRL v1.10.0 将 DistillationTrainer 和 DistillationConfig 从 trl.experimental.distillation 升级为顶层稳定 API,导入方式与 SFT / DPO / GRPO / KTO 一致,旧路径仍可用但会发出 FutureWarning(v2.0.0 移除)。
PEFT 发布 v0.20.0,一次性新增 HiRA、GLoRA、BEFT、MonteCLoRA、VeLoRA、Uni-LoRA、FRoD、MiCA、DEFT 九种参数高效微调方法,并新增面向图像生成方法的对比基准。
Berkeley AI Research 提出 ABBEL 框架,将 LLM 的摘要内容以自然语言"信念状态"形式隔离并监督,通过受自编码器启发的信念评分机制提升长程交互效率。在协作编程基准 CollabBench 上,采用重建式信念评分的 ABBEL-rec-BG 将全上下文模型的性能差距缩小约 50%,训练步数从 100 降至 50,峰值 token 数也显著低于全上下文设置。
Axolotl v0.18.0 发布,自 v0.17.0 以来累计超 90 次提交,主打低成本微调超大规模稀疏 MoE 模型。新增 NVFP4 MoE-LoRA,在 ScatterMoE 与 SonicMoE 后端支持 4-bit 专家 LoRA/QLoRA,4k 至 32k 上下文下显存占用近乎持平,并支持 GLM-5.2(DSA)2D 专家并行微调。
伯克利 EPIC Data Lab 提出,随着推理成本从 2023 年初 GPT-4 级约 $30/百万 token 降至如今不到 $1、部分低于 $0.10,数据系统面临三大新挑战:为智能体设计(Data Systems For Agents)、运行智能体(Of Agents)、由智能体构建(By Agents)。
Axolotl v0.17.0 发布,新增基于 DeepEP 的 MoE 专家并行(EP)训练、BitNet 1.58-bit 全量微调,以及通过 Tinker 兼容 API 的远程训练。
LLaMA-Factory 发布 v0.9.5,新增对 Qwen3.5/Qwen3.6、Gemma 4 模型的主要支持,并兼容 Transformers v5。
伯克利 AI 研究团队提出 GRASP,一种面向学习型世界模型的基于梯度的规划器,通过将轨迹提升到虚拟状态实现跨时间并行优化、在状态迭代上直接注入随机性以探索、并重塑梯度让动作获得清晰信号,从而让长时程规划变得可行。该方法针对长时程规划中梯度爆炸/消失、非贪心结构导致的局部极小值以及高维视觉模型带来的脆弱"状态-输入"梯度问题。
PEFT 发布 v0.19.0,一次性新增 GraLoRA、BD-LoRA、Cartridges、PVeRA、PSOFT、Lily、PEANuT、TinyLoRA、AdaMSS 共 9 种 PEFT 方法。
Axolotl 发布 v0.16.1,新增对 Gemma 4 的支持,并附带示例 YAML 配置。该版本自 v0.16.0 以来共合并 356 个提交,完整变更可通过 v0.16.0...v0.16.1 对比查看。
Axolotl 发布 v0.16.0,新增异步 GRPO 强化学习训练,集成 vLLM 并支持 LoRA 权重同步与 FP8,在 Qwen2-0.5B 上步时从 3.79s 降至 1.59s,提速 58%。
Axolotl 发布 v0.15.0,新增 GLM、Qwen3.5 及 Qwen3.5 MoE 模型支持,并引入 SonicMoE 内核与 ScatterMoE LoRA。
Axolotl 发布 v0.14.0,将底层 transformers 依赖从 v4 升级到 v5,并新增 MoE 内核选择(batched_mm、grouped_mm)及 scattermoe 自定义集成,显著提升 MoE 模型训练速度并降低显存占用。
伯克利 AI Research 提出一套基于互信息的成像系统评估与优化框架,可直接从含噪测量中估计信息量,并在 NeurIPS 2025 论文中验证。该指标在彩色摄影、射电天文、无镜头成像和显微成像四个领域均能预测解码器性能,优化后设计可媲美端到端方法,且内存与算力需求更低、无需任务专用解码器。
LlamaFactory 发布 v0.9.4,仓库名从 LLaMA-Factory 改为 LlamaFactory,弃用 Python 3.9–3.10、要求 3.11–3.13,并从 pip 迁移到 uv 安装。
PEFT 发布 0.18.0,新增 RoAd、ALoRA、Arrow、WaveFT、DeLoRA、OSF 六种微调方法。RoAd 通过逐元素乘法学习 2D 旋转矩阵,是除 LoRA 外唯一支持混合 adapter 批次的 PEFT 方法;ALoRA 可按 token 序列选择性启用 LoRA 并复用 KV cache。