LLaMA-Factory v0.9.5 发布:支持 Qwen3.5/3.6、Gemma 4 与 Transformers v5
LLaMA-Factory 发布 v0.9.5,新增对 Qwen3.5/Qwen3.6、Gemma 4 模型的主要支持,并兼容 Transformers v5。
LLaMA-Factory 发布 v0.9.5,新增对 Qwen3.5/Qwen3.6、Gemma 4 模型的主要支持,并兼容 Transformers v5。
DeepSpeed 发布 v0.19.1,新增 bf16 优化器状态 CPU offload 支持,并优化单例 MoE 通信、ZeRO-3 通过 mori 实现 SDMA allgather。该版本修复了 FastFileWriter 文件描述符泄漏、ZeRO-3 前向崩溃及 gemma4 注意力头等问题,同时支持 flash-attn 2.7.0 与 PyTorch v2.11 兼容。
CrewAI 的多智能体系统帮一家头部金融科技公司将每周合规报告生成时间从 16 小时(两天)压缩到不足 2 小时,单份报告周转时间减少 87%。该系统由自动提取五个内部系统数据的 Flow 与分析 Crew 组成,智能体分别负责汇总合规指标、撰写叙述并由协调者整合成报告,同时保留历史记忆与合规护栏。该团队在看到结果后签下六位数合同。
CrewAI 为一家年处理 15000+ 告警工单的中型全球企业 SaaS 厂商部署五智能体工作流,实现 Level 1 工单分诊全自动化,平均首次响应稳定在 20 分钟,满足 45 分钟合同 SLA。
LMDeploy 发布 v0.13.0,新增 Anthropic 兼容服务端点,并支持 TurboQuant(quant_policy=42)的 KV Cache 量化。
伯克利 AI 研究团队梳理了并行推理领域进展,指出当前多数方法(如 Self-consistency、Best-of-N、Tree of Thoughts、MCTS、ParaThinker、GroupThink、Hogwild!
CrewAI 的智能体架构帮助一家医疗机构将护士每日录入时间从 12 小时降至约 2.4 小时,减少 80%。该工作流由 Intake Reader、Insurance Eligibility、Routing、Orchestrator 等专职智能体分工协作,并配有 Validation Guardrails 监控准确性与合规性。
CrewAI 用三个专职智能体加一个编排器,为一家日均处理 5 万订单的电商公司自动化退货退款流程:请求分类、订单与政策核验、回复草拟,复杂案件才转人工。该方案目标是将退货处理人员减少 60%、每年节省超 120 万美元,请求处理速度提升一倍。
PEFT 发布 v0.19.0,一次性新增 GraLoRA、BD-LoRA、Cartridges、PVeRA、PSOFT、Lily、PEANuT、TinyLoRA、AdaMSS 共 9 种 PEFT 方法。
CrewAI 为一家全球饮料企业重建每周需求预测流程,用六个专职 AI 智能体组成自主工作流,分别负责编排、从 SAP S/4HANA 和 Databricks 取数、清洗、SKU 级预测、异常识别和报告生成。部署周期从约一个月缩短到两周,实现约 90% 自动化,原本五名分析师每周 40 小时的数据整理工作降至分钟级,代码与模型更新可在 30 分钟内上线。
Axolotl 发布 v0.16.0,新增异步 GRPO 强化学习训练,集成 vLLM 并支持 LoRA 权重同步与 FP8,在 Qwen2-0.5B 上步时从 3.79s 降至 1.59s,提速 58%。
随着 Claude Code 等 AI 智能体并行写代码,代码库正变成无人阅读的"只写代码",Brown 教授 Shriram Krishnamurthi 发现其生成的 bookstore 应用存在用浮点数算钱、自造 CSV 解析器等问题。
Axolotl 发布 v0.15.0,新增 GLM、Qwen3.5 及 Qwen3.5 MoE 模型支持,并引入 SonicMoE 内核与 ScatterMoE LoRA。
Continue 提出,AI 生成代码引发的低质问题应归因于流程缺失而非开发者个人。采用 AI 辅助编码的团队 PR 提交量提升 2-5 倍,但代码从 agent 到合并缺乏标准强制检查,无人拦截缺失的限流、输入校验等问题。Continue 将团队标准写成仓库中的 markdown 检查文件,每个 PR 上以完整 agent 运行,通过则静默、失败则给出具体问题和修复建议。
一位开发者用 8 波、每波 4 个并行 Claude Code 会话(各自独立 git worktree、先规划后构建),一天内合并 29 个 PR,净增 283 行代码(新增 3,917、删除 3,634),每个 PR 通过 27 项 AI 检查。
Continue 提出在 vibe coding 之后增加“Chiseling(凿刻)”环节,即人工重构和打磨 AI 生成的代码,把重复功能、1000 行方法和无用单测清理成清晰的逻辑核心。团队规模扩大后,凿刻会成为瓶颈,因此需要在 CI/CD 中引入云端智能体自动检查命名、抽象、测试与安全规范,把资深工程师的打磨标准编码为对每个 PR 的系统化审查。
Axolotl 发布 v0.14.0,将底层 transformers 依赖从 v4 升级到 v5,并新增 MoE 内核选择(batched_mm、grouped_mm)及 scattermoe 自定义集成,显著提升 MoE 模型训练速度并降低显存占用。
PEFT 发布 0.18.1 补丁版本,为适配即将到来的 transformers v5 修复了若干特殊场景问题,并修复了此前无意要求 transformers >= 4.52 的回归问题。该版本还修复了在 AMD ROCm 上运行 PEFT 的问题。
LlamaFactory 发布 v0.9.4,仓库名从 LLaMA-Factory 改为 LlamaFactory,弃用 Python 3.9–3.10、要求 3.11–3.13,并从 pip 迁移到 uv 安装。
Continue 提出 LLM 正在成为新的"胶水代码",用于粘合 webhook、CLI、REST API、数据库等格式各异的接口。其与 Snyk 合作将 AI 安全嵌入开发流程:Snyk 发出漏洞告警后,LLM 提取严重程度和受影响文件路径,生成补丁,再通过 CLI 跑测试并用 gh pr create 创建 PR。