跳到正文
10月8日周四
  1. Hugging Face Daily Papers22

    OmniCapBench:面向细粒度音视频描述的分层结构化评估框架

    OmniCapBench 将音视频描述评估重构为深度结构化诊断框架,把预测目标从自由文本转为实体引用、视觉镜头和音频事件三类原子化可验证评估单元,并基于 786 段密集标注视频进行确定性约束检查与局部 LLM 语义比较。评测前沿 MLLM 显示其局部感知较强,但长时程音视频推理薄弱,尤其存在身份漂移与跨模态错位问题。

10月7日周三
  1. Microsoft Research22

    Microsoft 研究员 Jennifer Neville 谈 AI 评测与「意外失败」的启示

    Microsoft 合伙人研究经理 Jennifer Neville 在 Microsoft Research Podcast 中讨论评测如何推动 AI 系统突破传统 benchmark 的性能边界,以及模型在超出常规测试时出现的「意外失败」。她结合自身从数学、物理、认知科学到计算机科学的经历,分享与当前 AI 系统协作的实用建议,并强调当结果偏离预期时应仔细审视数据。

10月5日周一
10月4日周日
  1. Hugging Face Blog71

    微软与 Hugging Face 发布 ThinkingBox:按数据库终态给 AI 智能体打分

    微软 Copilot Studio 团队与 Hugging Face 联合发布 ThinkingBox,它让智能体在隔离的 MCP 工具会话中运行,只根据最终后端状态和副作用打分,而不是看模型生成的文字。

    推荐理由:微软与 Hugging Face 联合发布的智能体评测基准,用数据库终态而非模型自述来判定成败,并给出 20 次重复下的可靠性数据。

9月30日周三
8月20日周四
  1. Mistral AI71

    Mistral 发布 Agentic Search 检索层,FinanceBench 准确率提升至 86%

    Mistral 发布 Agentic Search,一个让模型在多步检索循环中查找、检查和验证信息的检索层,通过 Mistral Search Toolkit 提供,并内置于 Studio 和 Vibe 的 Libraries。

    推荐理由:原文给出多步检索循环在 FinanceBench 与 OfficeQA Pro 上的准确率、token 与延迟变化,可据此判断传统 one-shot RAG 的边界。

7月31日周五
  1. Sourcegraph Blog28

    如何在自有代码库上评估 Sourcegraph

    Sourcegraph 给出了一套在自有代码库上评估其 MCP server 的方法:在 288 个任务中,结构化检索把文件级 F1 从 0.091 提升到 0.240、recall 从 0.120 提升到 0.272,但整体任务完成奖励基本不变。成本则因任务而异,基线智能体广泛搜索时节省 15% 至 51%,基线仅需七次以内搜索即可定位时平均多花 $0.15。

7月28日周二
7月23日周四
  1. Sourcegraph Blog40

    Sourcegraph 推出 Code Finder:为编程智能体提供快速高效的代码搜索

    Sourcegraph 在 MCP server 中上线智能体搜索工具 Code Finder,它自行运行搜索循环,直接返回匹配的文件路径、行范围和用途说明。基准测试显示,Code Finder 比使用本地搜索工具的编程智能体快 2 倍以上,比调用其 MCP 工具的智能体成本低最多 40%,结果质量相当。该工具已通过 MCP 正式可用,并为 Deep Search 提供文件发现能力。