TestPrism:重新思考超越单一参考实现的测试评估
LLM 编码智能体生成的测试通常只对照单一参考解评估,会高估测试质量。TestPrism 包含来自 17 个来源的 300 个测试任务和 3000 个候选实现,其 Joint Success Function 指标要求测试在初始程序状态失败、接受所有有效实现并拒绝所有无效实现,14 种基线配置下仅达 28.00%,而单一参考成功率高达 59.67%。
LLM 编码智能体生成的测试通常只对照单一参考解评估,会高估测试质量。TestPrism 包含来自 17 个来源的 300 个测试任务和 3000 个候选实现,其 Joint Success Function 指标要求测试在初始程序状态失败、接受所有有效实现并拒绝所有无效实现,14 种基线配置下仅达 28.00%,而单一参考成功率高达 59.67%。
TRL 发布 v1.14.2 补丁,修复两处静默训练错误和三处崩溃。其中 #7505 影响默认生成路径(use_vllm=False)下的 GRPO、RLOO 和 Distillation。
TRL 发布 v1.14.1,修复了 vLLM 0.20 至 0.25 上首次权重同步时的 server 模式崩溃问题。该版本还修复了 vLLM server 模式下工具调用后每个样本只生成一个 completion 的问题,并让 CLI 脚本保留显式的 model_init_kwargs、正确响应 resume_from_checkpoint。
PEFT 发布 v0.21.1,使 Tensor Parallel(TP)能够与 PEFT 正常配合工作,需搭配 Transformers ≥ 5.17.0 使用。该版本为小型更新,包含 #3614、#3790 两项改动。
TRL v1.14.0 移除了 v1.13 引入的 trl.losses 模块,DPO、KTO、GRPO 改为通过 _ChunkedLogProbFunction 流式计算所选 token 的 log-probs,各自复用原有损失代码,不再重复实现损失数学。
PEFT 发布 v0.21.0,新增 Riemannian 预条件 LoRA 优化器、LoRA 变体 KaSA、Super-Tuning 和 ShadowPEFT 四种方法。
TRL v1.13.0 新增 1M token 长上下文训练支持,在单台 8×H100 节点上以 Qwen3-8B 实测 1,048,576 token、380 秒/步、每 GPU 56.2 GB(bf16)。
TRL v1.12.0 是 v1.11.0 的意外重复版本,两者在 PyPI 上的代码逐字节相同,没有任何新功能、修复或行为变化。
TRL v1.11.0 发布,其 vllm-serve 不再自建 FastAPI 服务,改为转发到 vLLM 原生 server,脚本从 1218 行降至约 130 行,权重同步改用 vLLM 的 NCCL weight-transfer 引擎。
TRL v1.10.0 将 DistillationTrainer 和 DistillationConfig 从 trl.experimental.distillation 升级为顶层稳定 API,导入方式与 SFT / DPO / GRPO / KTO 一致,旧路径仍可用但会发出 FutureWarning(v2.0.0 移除)。
PEFT 发布 v0.20.0,一次性新增 HiRA、GLoRA、BEFT、MonteCLoRA、VeLoRA、Uni-LoRA、FRoD、MiCA、DEFT 九种参数高效微调方法,并新增面向图像生成方法的对比基准。
smolagents 发布 v1.26.0,WebSearchTool 新增 Exa 作为搜索引擎选项,同时移除了远程 WasmExecutor。该版本还回滚了 ToolSerializer.dumps 的 f-string 转义修复,并更新了 LocalPythonExecutor 的 docstring。
smolagents 发布 v1.25.0,修复远程执行器的高危漏洞,并将 WasmExecutor 通配符绑定改为仅回环端点、为 Docker 与 Wasm 执行器引入 token 认证。该版本还移除旧版无前缀 pickle 支持、将 allow_pickle 默认设为 False,并新增 MLflow 集成文档与 Python 执行器参考页。
PEFT 发布 v0.19.1 补丁版本,包含 #3161 和 #3165 两项修复。该版本由 BenjaminBossan 于 4 月 16 日发布,自上一版本以来主分支已有 325 次提交。
PEFT 发布 v0.19.0,一次性新增 GraLoRA、BD-LoRA、Cartridges、PVeRA、PSOFT、Lily、PEANuT、TinyLoRA、AdaMSS 共 9 种 PEFT 方法。
smolagents 发布 v1.24.0,新增对 gpt-5.2* 系列模型的无停止序列支持,并为 Python 代码执行加入健壮的超时机制。该版本还兼容 Gradio 6,支持向 apply_chat_template 传递额外参数,并将 API 返回的工具调用统一转换为 smolagents 的 ChatMessageToolCall 格式。
PEFT 发布 0.18.1 补丁版本,为适配即将到来的 transformers v5 修复了若干特殊场景问题,并修复了此前无意要求 transformers >= 4.52 的回归问题。该版本还修复了在 AMD ROCm 上运行 PEFT 的问题。
smolagents 发布 v1.23.0,将默认 InferenceClient 模型切换为 Qwen/Qwen3-Next-80B-A3B-Thinking,并新增 gpt-5.1 支持。
PEFT 发布 0.18.0,新增 RoAd、ALoRA、Arrow、WaveFT、DeLoRA、OSF 六种微调方法。RoAd 通过逐元素乘法学习 2D 旋转矩阵,是除 LoRA 外唯一支持混合 adapter 批次的 PEFT 方法;ALoRA 可按 token 序列选择性启用 LoRA 并复用 KV cache。