在执行点应用安全设计:受治理的安全需求如何影响 AI 生成代码的安全性
研究将来自 SbD-ToE 知识库的安全需求通过 MCP server 在执行点提供给代码生成器,在 DualGauge 的 59 个 Python 任务上,通过全部安全测试的任务占比从 44.1% 升至 78.0%。
研究将来自 SbD-ToE 知识库的安全需求通过 MCP server 在执行点提供给代码生成器,在 DualGauge 的 59 个 Python 任务上,通过全部安全测试的任务占比从 44.1% 升至 78.0%。
微软 Copilot Studio 团队与 Hugging Face 联合发布 ThinkingBox,它让智能体在隔离的 MCP 工具会话中运行,只根据最终后端状态和副作用打分,而不是看模型生成的文字。
推荐理由:微软与 Hugging Face 联合发布的智能体评测基准,用数据库终态而非模型自述来判定成败,并给出 20 次重复下的可靠性数据。