Microsoft 研究员 Jennifer Neville 谈 AI 评测与「意外失败」的启示
Microsoft 合伙人研究经理 Jennifer Neville 在 Microsoft Research Podcast 中讨论评测如何推动 AI 系统突破传统 benchmark 的性能边界,以及模型在超出常规测试时出现的「意外失败」。她结合自身从数学、物理、认知科学到计算机科学的经历,分享与当前 AI 系统协作的实用建议,并强调当结果偏离预期时应仔细审视数据。
Microsoft 合伙人研究经理 Jennifer Neville 在 Microsoft Research Podcast 中讨论评测如何推动 AI 系统突破传统 benchmark 的性能边界,以及模型在超出常规测试时出现的「意外失败」。她结合自身从数学、物理、认知科学到计算机科学的经历,分享与当前 AI 系统协作的实用建议,并强调当结果偏离预期时应仔细审视数据。
GitHub Copilot 应用中的 canvas(画布扩展)是一种用户与智能体共享的可定制界面,可做成看板、issue 分诊板、发布清单或仪表盘,且双向同步——智能体更新画布,用户也能通过按钮、卡片、筛选器直接修改。
GitHub Copilot 提出用 canvas 替代 chat 作为 AI 主要交互界面,canvas 是运行在 GitHub Copilot app 内的全栈应用,可与 agent 双向通信并调用第三方 API、在本地执行代码。
GitHub Copilot 应用重建了 pull request 视图,以应对超大 diff 与评论带来的渲染压力,实测对象是一个包含 2,200 个文件、超 100 万行改动和 400 多条行内评论的开源 pull request。方案将文档高度拆成确定性的代码几何与动态块几何两部分:代码行高可提前精确计算,评论、草稿和回复框则按块惰性测量,并锚定到文件、行号和侧别而非像素坐标。