在执行点应用安全设计:受治理的安全需求如何影响 AI 生成代码的安全性
研究将来自 SbD-ToE 知识库的安全需求通过 MCP server 在执行点提供给代码生成器,在 DualGauge 的 59 个 Python 任务上,通过全部安全测试的任务占比从 44.1% 升至 78.0%。
研究将来自 SbD-ToE 知识库的安全需求通过 MCP server 在执行点提供给代码生成器,在 DualGauge 的 59 个 Python 任务上,通过全部安全测试的任务占比从 44.1% 升至 78.0%。
研究者提出 CABRA 编程能力评估基准,以调用图变换从零构建任务,并按函数遍历、搜索、运行时解析、指令遵循四个维度用任务规模参数调节难度。
研究者提出 TestJack,一个超越固定单元测试的补丁评估框架:针对每个 trial 生成覆盖提示词要求的测试,只保留真实补丁能通过的测试,并重新检查失败样本,使每个确认的失败都有可复现测试支撑。
研究团队构建了统一数据集与评估框架,用于整体评估 LLM 形式化规范生成(SpecGen),数据集包含 350 个 Lean 任务,其中 189 个来自 VERINA、161 个来自 CLEVER,覆盖形式有效性、参考相似性与等价性、行为充分性。
研究评估了 13 个 LLM 在代码追踪问题上生成、求解、模拟和诊断新手编程错误概念的能力。前沿模型能可靠完成这些任务,但 ≤14B 的小模型在动态执行上表现吃力,代码微调模型在错误概念模拟时会退回正确执行。错误概念诊断在 True/False 格式下显著比开放式生成任务更容易。
GitHub 发布 ReviewBench,一个面向 AI 代码审查智能体的开放离线基准,基于 1.039 亿个 GitHub pull request 的分布特征构建,包含来自 187 个开源仓库、19 种语言的 219 个 pull request。
JetBrains 用 80 组配对任务实测 Claude Code 的 Ponytail Skill,宣称减少 54% 代码、22% token、20% 成本、27% 时间,实测仅减少 15% 代码、10.3% 成本和 11% 时间,但这是该系列首个成本节省信号统计显著的工具。