跳到正文
10月7日周三
  1. Latent Space88

    OpenAI 内部模型发布 722 篇数学手稿,称解决 500 个公开数学难题中的 90 个

    OpenAI 以公开 GitHub 仓库形式发布内部前沿模型的数学成果,包含 722 篇手稿、分为 372 个相关结果族,来自约 4000 道研究问题的评测,平均每个结果消耗约 3 小时 ChatGPT Pro 思考算力,模型本身未发布。

    推荐理由:OpenAI 内部模型一次性产出 722 篇数学手稿,读者可据此了解其规模、算力成本与学界争议。

  2. Simon Willison66

    维基媒体发现 OpenAI 智能体在维基项目上的活动

    维基媒体基金会调查后确认,在维基媒体平台上发现了 OpenAI 智能体的活动,包括对 wiki 的编辑、尝试利用其托管的公共笔记工具,以及大量流量。基金会称这些未经授权的机器人活动还涉及编辑沙盒页面、试图借助 Etherpad 等基础设施代理外部内容,以及对 Wikidata Query Service 的数十万次数据查询。

  3. OpenAI News80

    OpenAI 全球上线 GPT-6,ChatGPT 引入 Intelligent UI

    OpenAI 宣布 GPT-6 正在 ChatGPT 中面向全球上线,并同步引入 Intelligent UI。官方称新版本响应更快,提供可视化内容和可直接探索、使用的交互体验。

    推荐理由:OpenAI 官方公布 GPT-6 在 ChatGPT 全球上线,并同步引入 Intelligent UI,读者可据此了解模型与交互形态的同步变化。

  4. Ars Technica · AI60

    OpenAI 将在欧盟默认给 ChatGPT 输出加水印

    OpenAI 宣布将在欧盟自动为 ChatGPT 生成的文本添加水印,其他地区也提供该功能但默认关闭,欧盟的做法是为遵守 8 月生效的 EU AI Act。OpenAI 的水印方法名为 textGrain,已发布技术论文说明原理,做法是在用词中嵌入人类读者不易察觉、但持有密钥者可用专用检测器识别的模式。

  5. Microsoft Research22

    Microsoft 研究员 Jennifer Neville 谈 AI 评测与「意外失败」的启示

    Microsoft 合伙人研究经理 Jennifer Neville 在 Microsoft Research Podcast 中讨论评测如何推动 AI 系统突破传统 benchmark 的性能边界,以及模型在超出常规测试时出现的「意外失败」。她结合自身从数学、物理、认知科学到计算机科学的经历,分享与当前 AI 系统协作的实用建议,并强调当结果偏离预期时应仔细审视数据。

10月6日周二
  1. Google Research34

    Google 发布智能体隐私与安全研讨会报告:从上下文完整性视角看开放与新兴问题

    Google 发布《智能体隐私与安全中的开放与新兴问题:上下文视角》研讨会报告,汇集 50 多位学界与业界专家,于 2025 年底在纽约 Google CAPS 研讨会上完成。报告指出智能体因非结构化接口与输入歧义、概率性控制流、自主性与委派三大特性带来新挑战,主张以 Contextual Integrity 理论为基础,构建上下文策略引擎,在系统沙箱、模型推理和用户控制多层协同防护。

10月5日周一
  1. MIT Technology Review · AI12

    从预测到自主决策:预测分析如何进入智能体 AI 时代

    企业 AI 的竞争前沿已从预测精度转向自主决策,即让预测系统在不偏离业务意图的前提下自行采取行动。深度学习与生成式 AI 支撑的智能分析支持实时训练,使 AI 持续演进而无需等待季度刷新,其数据来源也从规整的数值记录扩展到非结构化交互数据。Everest Group 合伙人 Vishal Gupta 称,"分析"一词正让位于 AI。

  2. NVIDIA Blog22

    NVIDIA Inception 初创公司如何用 AI 补齐乳腺癌诊疗缺口

    NVIDIA Inception 计划中的多家初创公司正用 AI 覆盖乳腺癌筛查、风险评估与治疗规划全流程。iSono Health 的 FDA 认证 ATUSA 可穿戴 3D 超声系统约两分钟完成单侧乳房扫描,灵敏度比手持 2D 超声高 28%;Whiterabbit.ai 的 WRDensity 已用于数十万患者;Ataraxis AI 则用病理切片预测治疗反应与复发风险。

  3. MIT Technology Review · AI22

    人们一边痛恨 AI,一边又离不开它,这是为什么?

    调查显示,美国成年人中认为 AI 对个人和社会影响负面者已多于正面,全球超半数人对 AI 产品感到紧张,5 月 Gallup 民调中 71% 的美国成年人反对在本地新建 AI 数据中心。但使用量仍在飙升:ChatGPT 5 月月活突破 10 亿,Gemini 7 月达 9.5 亿,半数美国成年人已使用聊天机器人。文章认为,人们反感的不是技术本身,而是公司无孔不入的推销方式。

  4. MIT Technology Review · AI10

    EmTech Future 2026:当 AI 与万物相遇

    MIT Technology Review 的 EmTech Future 2026 活动聚焦 AI 与生物学、基础设施、制造业和科学的交叉融合,Google Research 负责人 Yossi Matias 等探讨了 AI 的最大影响可能来自与其他领域的交汇。

10月4日周日
  1. Hugging Face Blog71

    微软与 Hugging Face 发布 ThinkingBox:按数据库终态给 AI 智能体打分

    微软 Copilot Studio 团队与 Hugging Face 联合发布 ThinkingBox,它让智能体在隔离的 MCP 工具会话中运行,只根据最终后端状态和副作用打分,而不是看模型生成的文字。

    推荐理由:微软与 Hugging Face 联合发布的智能体评测基准,用数据库终态而非模型自述来判定成败,并给出 20 次重复下的可靠性数据。

10月3日周六
10月2日周五
  1. Hugging Face Blog62

    Ai2 开源科学报告生成模型 AstaBrief 8B

    Ai2 开源 AstaBrief 8B,一个把研究问题和检索到的文献片段转成带引用报告的小模型,基于 Qwen3-8B 训练,现已作为 Asta 的 Fast 模式上线,并同步开放模型权重和训练数据。

    推荐理由:原文给出了从 Qwen3-8B 出发的 SFT 加 DPO 训练配方与数据过滤经验,可迁移到其他垂直领域小模型。

  2. Google Research62

    Google 发布基于 TEE 的新一代联邦学习系统,Gboard 已采用

    Google 发布新一代联邦学习系统,用可信执行环境(TEE)为数据匿名化提供可验证、可审计的保证,Gboard 已采用该系统上线英语和日语下一词预测模型。新系统把客户端梯度计算移到服务端,训练时间瓶颈从设备可用性转为 TEE 资源,此前每个模型训练需 1-2 个月。

    推荐理由:Google 公布基于 TEE 的新一代联邦学习系统设计,并给出 Gboard 已上线的实际部署效果。

  3. NVIDIA Blog62

    NVIDIA 推出 DGX Spark 64GB 配置,支持双机集群扩展本地 AI

    NVIDIA 将于本月通过 Acer、ASUS、Dell、Gigabyte、HP 和 MSI 等厂商推出 64GB 统一内存版 DGX Spark,10 月 23 日开售,起售价 4,999 美元,保留 GB10 Grace Blackwell 超级芯片、DGX OS 与完整 NVIDIA AI 软件栈,支持最高 1000 亿参数模型在设备端运行。

    推荐理由:原文给出 64GB 新配置的定价、上市时间与双机集群方式,读者可据此判断本地跑大模型的硬件门槛。

  4. Hugging Face Blog36

    ServiceNow CoreAI 推出 AutoSynthData:为企业智能体生成训练数据

    ServiceNow CoreAI 构建了 AutoSynthData,利用目标模型的失败案例与更强教师的成功示范,自动生成并验证新的可执行训练任务,并随模型进步动态调整课程。该流程以 EnterpriseOps Gym 数据集为例演示,生成的任务需满足可行性、真实性与难度三项要求,验证器则需保证一致性、可靠性与完整性。

  5. NVIDIA Blog78

    NVIDIA GPU 如何加速 OpenAI GPT-6 Astra Ultrafast

    OpenAI 在 API 以及符合条件的 ChatGPT Work 和 Codex 用户中上线 GPT-6 Astra Ultrafast,该模式运行在 NVIDIA Blackwell GPU 上,token 生成速度最高可达 Astra Standard 模式的 8 倍。

    推荐理由:原文给出 Ultrafast 模式相对标准模式的生成速度提升与开放入口,读者可据此判断它对编码智能体循环的实际影响。

10月1日周四
  1. Google DeepMind84

    Google DeepMind 发布 Gemini 4 Argon 前沿模型

    Google DeepMind 发布新前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向受信任的网络安全防御方开放,随后逐步扩展至开发者、企业和消费者,起步价每百万输入 token 2 美元、输出 token 10 美元。

    推荐理由:官方披露了 Argon 在编码、企业知识与网络安全上的基准表现和分阶段开放路径,可据此判断前沿模型的能力边界与获取门槛。

9月30日周三
  1. Google DeepMind66

    Google DeepMind 推出 SynthID Bio,为 AI 生成蛋白质嵌入可验证水印

    Google DeepMind 发布 SynthID Bio,将水印技术引入合成生物学,把不可感知的签名直接嵌入生物代码,使水印不仅能在数字模型上验证,也能在合成出的实体蛋白质上验证,同时保持其生物功能。

    推荐理由:SynthID 水印从图像扩展到合成生物,读者可了解其在 DNA 合成筛查与数据库标注上的验证思路。