RISEBench++:面向推理驱动视觉编辑的基准与 RISE-Agent 框架
研究者推出 RISEBench++,一个面向推理驱动视觉编辑(RISE)的基准,涵盖 Temporal、Causal、Spatial、Logical、Counterfactual 与 Hybrid 六类推理维度,细分为 12 个子类和 65 种任务类型,含 1000 条中英双语人工标注测试用例。
研究者推出 RISEBench++,一个面向推理驱动视觉编辑(RISE)的基准,涵盖 Temporal、Causal、Spatial、Logical、Counterfactual 与 Hybrid 六类推理维度,细分为 12 个子类和 65 种任务类型,含 1000 条中英双语人工标注测试用例。
研究者推出 SpaceCast-Bench,首个直接诊断预测性空间推理的基准,基于 observe-transform-infer 框架,从 182 个真实场景构建 3,862 道题,覆盖静态感知、局部预测与全局预测三个层级共 16 种任务。
研究者提出 CABRA 编程能力评估基准,以调用图变换从零构建任务,并按函数遍历、搜索、运行时解析、指令遵循四个维度用任务规模参数调节难度。
研究者提出 TestJack,一个超越固定单元测试的补丁评估框架:针对每个 trial 生成覆盖提示词要求的测试,只保留真实补丁能通过的测试,并重新检查失败样本,使每个确认的失败都有可复现测试支撑。
研究基于 SESR-Eval 基准及新构建的 SESR-Eval-Mini 数据集,评估了八款新 LLM 在软件工程系统综述筛选任务上的表现,平均 MCC 仅从旧模型的 0.347 微升至 0.365。
研究团队构建了统一数据集与评估框架,用于整体评估 LLM 形式化规范生成(SpecGen),数据集包含 350 个 Lean 任务,其中 189 个来自 VERINA、161 个来自 CLEVER,覆盖形式有效性、参考相似性与等价性、行为充分性。
研究评估了 13 个 LLM 在代码追踪问题上生成、求解、模拟和诊断新手编程错误概念的能力。前沿模型能可靠完成这些任务,但 ≤14B 的小模型在动态执行上表现吃力,代码微调模型在错误概念模拟时会退回正确执行。错误概念诊断在 True/False 格式下显著比开放式生成任务更容易。
星动纪元自研世界动作模型VPP2登顶RoboDojo仿真榜单,综合平均成功率32.26%、平均得分39.26分,两项指标均列第一,领先GPT-6-Astra的22.48%和28.97分。
Anthropic 发布 Claude Haiku 5.5,这是其最快、最便宜的小模型,平均成本比 Haiku 4.5 低约 75%,提示词不超过 10 万 token 的请求价格最高下降 90%,超过 10 万 token 的请求价格则是前者的五倍。
推荐理由:Anthropic 发布 Haiku 5.5 并大幅降价,读者可据此判断小模型在成本敏感任务中的定位与取舍。
Anthropic 发布 Claude Haiku 5.5,这是 Haiku 系列约一年来的首次更新,定价与 OpenAI 的 GPT-6 Luna 持平,官方称其平均运行成本比 Haiku 4.5 低约 75%。
推荐理由:汇总了 Haiku 5.5 的定价、第三方评测与 token 消耗数据,可据此判断小模型在智能体工作流中的成本取舍。
OmniCapBench 将音视频描述评估重构为深度结构化诊断框架,把预测目标从自由文本转为实体引用、视觉镜头和音频事件三类原子化可验证评估单元,并基于 786 段密集标注视频进行确定性约束检查与局部 LLM 语义比较。评测前沿 MLLM 显示其局部感知较强,但长时程音视频推理薄弱,尤其存在身份漂移与跨模态错位问题。
研究者提出 BrickBench,一个面向智能体文本条件 LEGO 套装设计的基准,要求智能体从离散零件库中选件并同时推理局部与全局约束,产出满足语义与设计标准且可实际拼装的方案。配套环境 BrickAgent 让编程智能体构建、检查并验证设计,评测覆盖三种规模与零件可用性设置,从有效性、对齐度和设计三方面打分。结果显示领先智能体基本满足可验证的物理与语义要求,但仍不及人类设计。
英伟达团队基于 Nemotron 3,用监督微调、强化学习和反馈驱动的推理流程,在 IOI 2026 和 IMO 2026 两项竞赛中均达到金牌水平。
推荐理由:原文公开了从 Nemotron 3 微调到 IOI、IMO 金牌级成绩的完整配方与数据集,可据此复现领域专家模型的训练与推理流程。
GitHub 发布 ReviewBench,一个面向 AI 代码审查智能体的开放离线基准,基于 1.039 亿个 GitHub pull request 的分布特征构建,包含来自 187 个开源仓库、19 种语言的 219 个 pull request。
微软 Copilot Studio 团队与 Hugging Face 联合发布 ThinkingBox,它让智能体在隔离的 MCP 工具会话中运行,只根据最终后端状态和副作用打分,而不是看模型生成的文字。
推荐理由:微软与 Hugging Face 联合发布的智能体评测基准,用数据库终态而非模型自述来判定成败,并给出 20 次重复下的可靠性数据。
Hugging Face 发布 Open TTS Leaderboard,用客观指标评测开源多语言 TTS 与声音克隆模型,单模型评测耗时从数周投票缩短到数小时。
JetBrains 用 80 组配对任务实测 Claude Code 的 Ponytail Skill,宣称减少 54% 代码、22% token、20% 成本、27% 时间,实测仅减少 15% 代码、10.3% 成本和 11% 时间,但这是该系列首个成本节省信号统计显著的工具。