跳到正文
今天10月9日周五1 条
10月8日周四
  1. The Decoder77

    Anthropic 发布 Claude Haiku 5.5,价格最高下调 90%

    Anthropic 发布 Claude Haiku 5.5,这是其最快、最便宜的小模型,平均成本比 Haiku 4.5 低约 75%,提示词不超过 10 万 token 的请求价格最高下降 90%,超过 10 万 token 的请求价格则是前者的五倍。

    推荐理由:Anthropic 发布 Haiku 5.5 并大幅降价,读者可据此判断小模型在成本敏感任务中的定位与取舍。

10月7日周三
  1. Microsoft Research22

    Microsoft 研究员 Jennifer Neville 谈 AI 评测与「意外失败」的启示

    Microsoft 合伙人研究经理 Jennifer Neville 在 Microsoft Research Podcast 中讨论评测如何推动 AI 系统突破传统 benchmark 的性能边界,以及模型在超出常规测试时出现的「意外失败」。她结合自身从数学、物理、认知科学到计算机科学的经历,分享与当前 AI 系统协作的实用建议,并强调当结果偏离预期时应仔细审视数据。

10月5日周一
10月4日周日
  1. Hugging Face Blog71

    微软与 Hugging Face 发布 ThinkingBox:按数据库终态给 AI 智能体打分

    微软 Copilot Studio 团队与 Hugging Face 联合发布 ThinkingBox,它让智能体在隔离的 MCP 工具会话中运行,只根据最终后端状态和副作用打分,而不是看模型生成的文字。

    推荐理由:微软与 Hugging Face 联合发布的智能体评测基准,用数据库终态而非模型自述来判定成败,并给出 20 次重复下的可靠性数据。

10月3日周六
9月30日周三
8月20日周四
  1. Mistral AI71

    Mistral 发布 Agentic Search 检索层,FinanceBench 准确率提升至 86%

    Mistral 发布 Agentic Search,一个让模型在多步检索循环中查找、检查和验证信息的检索层,通过 Mistral Search Toolkit 提供,并内置于 Studio 和 Vibe 的 Libraries。

    推荐理由:原文给出多步检索循环在 FinanceBench 与 OfficeQA Pro 上的准确率、token 与延迟变化,可据此判断传统 one-shot RAG 的边界。

8月17日周一