跳到正文
10月8日周四
  1. Google Research62

    Google Research 研究:AI 辅助提升专利撰写产出,但未必加速初级律师成长

    Google Research 在 NBER 发布一项为期三个月的专利撰写实地实验,将当时未发布的 Google Labs AI 专利写作助手(现属 Gemini Notebook)随机开放给 11 家知识产权律所的 133 名律师,其中三分之二获得早期访问权。

    推荐理由:三个月专利撰写实验区分了 AI 带来的即时产出提升与无辅助判断力的变化,为理解 AI 对专业能力的影响提供了实证。

  2. Hugging Face Daily Papers22

    OmniCapBench:面向细粒度音视频描述的分层结构化评估框架

    OmniCapBench 将音视频描述评估重构为深度结构化诊断框架,把预测目标从自由文本转为实体引用、视觉镜头和音频事件三类原子化可验证评估单元,并基于 786 段密集标注视频进行确定性约束检查与局部 LLM 语义比较。评测前沿 MLLM 显示其局部感知较强,但长时程音视频推理薄弱,尤其存在身份漂移与跨模态错位问题。

  3. Hugging Face Daily Papers32

    准确但不谦逊:知识冲突下 LLM 智能体的认知谦逊评估

    研究提出用认知谦逊(EH)评估 LLM 智能体在知识冲突下的表现,通过 Identify、Solve、Escalate(ISE)三个轨迹级行为维度,在受控冲突与多步执行中的自然冲突两种设定下评测四个智能体。结果显示更高任务准确率并不必然对应更强的认知谦逊:部分高准确率配置能识别冲突,却不在错误答案中传达未解决的不确定性。轨迹分析还发现智能体常在执行早期检测到冲突,却在后续步骤中未能维持或解决。

  4. Hugging Face Daily Papers22

    BrickBench:评估智能体积木设计

    研究者提出 BrickBench,一个面向智能体文本条件 LEGO 套装设计的基准,要求智能体从离散零件库中选件并同时推理局部与全局约束,产出满足语义与设计标准且可实际拼装的方案。配套环境 BrickAgent 让编程智能体构建、检查并验证设计,评测覆盖三种规模与零件可用性设置,从有效性、对齐度和设计三方面打分。结果显示领先智能体基本满足可验证的物理与语义要求,但仍不及人类设计。

10月7日周三
10月6日周二
  1. Google Research34

    Google 发布智能体隐私与安全研讨会报告:从上下文完整性视角看开放与新兴问题

    Google 发布《智能体隐私与安全中的开放与新兴问题:上下文视角》研讨会报告,汇集 50 多位学界与业界专家,于 2025 年底在纽约 Google CAPS 研讨会上完成。报告指出智能体因非结构化接口与输入歧义、概率性控制流、自主性与委派三大特性带来新挑战,主张以 Contextual Integrity 理论为基础,构建上下文策略引擎,在系统沙箱、模型推理和用户控制多层协同防护。

10月5日周一
  1. Hugging Face Daily Papers31

    MC-Sparse:弥合扩散 Transformer 中稠密与稀疏注意力的差距

    针对扩散 Transformer 长序列生成中稀疏注意力导致质量下降的问题,研究者提出免训练框架 MC-Sparse,通过缓存查询分组、KV 索引与稠密-稀疏注意力残差并在去噪步骤间复用,实现更高保真度。在 Minimax-H3-Base 上取得 1.80 倍去噪加速,3D 资产生成上达 2.32 倍,质量损失可忽略。

10月4日周日
  1. Hugging Face Blog71

    微软与 Hugging Face 发布 ThinkingBox:按数据库终态给 AI 智能体打分

    微软 Copilot Studio 团队与 Hugging Face 联合发布 ThinkingBox,它让智能体在隔离的 MCP 工具会话中运行,只根据最终后端状态和副作用打分,而不是看模型生成的文字。

    推荐理由:微软与 Hugging Face 联合发布的智能体评测基准,用数据库终态而非模型自述来判定成败,并给出 20 次重复下的可靠性数据。

  2. Hugging Face Daily Papers22

    LLM 能否理解序列结构?一项关于推理与生成的受控研究

    一项受控研究用双人石头剪刀布和单人随机 n-gram 续写任务,测试 LLM 能否识别潜在策略、遵循简单马尔可夫规则并维持高阶条件依赖。结果显示更长的上下文并不能提升识别能力,正确识别也不保证忠实模拟,高阶依赖会显著削弱规则恢复,表面行为保真可能掩盖错误的生成机制。

10月2日周五
  1. Google Research62

    Google 发布基于 TEE 的新一代联邦学习系统,Gboard 已采用

    Google 发布新一代联邦学习系统,用可信执行环境(TEE)为数据匿名化提供可验证、可审计的保证,Gboard 已采用该系统上线英语和日语下一词预测模型。新系统把客户端梯度计算移到服务端,训练时间瓶颈从设备可用性转为 TEE 资源,此前每个模型训练需 1-2 个月。

    推荐理由:Google 公布基于 TEE 的新一代联邦学习系统设计,并给出 Gboard 已上线的实际部署效果。

  2. Hugging Face Blog36

    ServiceNow CoreAI 推出 AutoSynthData:为企业智能体生成训练数据

    ServiceNow CoreAI 构建了 AutoSynthData,利用目标模型的失败案例与更强教师的成功示范,自动生成并验证新的可执行训练任务,并随模型进步动态调整课程。该流程以 EnterpriseOps Gym 数据集为例演示,生成的任务需满足可行性、真实性与难度三项要求,验证器则需保证一致性、可靠性与完整性。

10月1日周四
9月30日周三
9月28日周一
  1. Hugging Face Daily Papers22

    ReSPO:重塑序列策略优化,解决离策略学习中的梯度饥饿问题

    针对 RLVR 中复用 rollout 导致的梯度饥饿问题,研究者提出 ReSPO(Reshaped Sequence Policy Optimization),用基于 α-散度变分目标与指数方差控制倾斜的平滑双分支序列级核函数替代 clipping:正分支为欠生成的正面回复保留非零梯度权重,负分支抑制严重过度生成的负面回复。

9月25日周五
9月24日周四
  1. Microsoft Research62

    微软研究院:把物理 AI 推理卸载到边缘或云端可提升机器人性能与续航

    微软研究院对移动操作机器人工作负载做了首次系统性测量,发现把物理 AI 推理从机器人端侧 GPU 卸载到边缘或云端 GPU 可提升任务成功率、支持更大模型并延长续航。

    推荐理由:微软研究院系统测量了机器人端侧 GPU 推理的瓶颈,并给出可复用的 Kubernetes 卸载工具链,读者可据此判断物理 AI 的部署取舍。

9月21日周一
  1. Microsoft Research50

    微软开源逆合成模型 RetroChimera,成果登上 Nature

    微软研究院在 Nature 发表逆合成模型 RetroChimera,并开源其实现与权重。该模型用学习式重排序整合 Transformer 模型 R-SMILES 2 与 GNN 模型 NeuralLoc 的互补预测,在十项挑战性靶标的多步合成路线评测中成功 9 项,优于 de novo 模型的 5 项、编辑模型的 4 项和 NeuralSym 的 2 项。

9月19日周六
9月18日周五
7月29日周三
  1. Berkeley AI Research62

    从 CUDA 到 MLX:K-Search 如何把内核优化经验带到 Apple Silicon

    Berkeley AI Research 与 IBM Research 将 K-Search 进化式内核搜索框架扩展到 MLX,通过结构化 CUDA-to-MLX 翻译层把已有 CUDA 内核经验迁移到 Apple Silicon。

    推荐理由:展示了把 CUDA 内核优化经验结构化迁移到 Apple Silicon 的方法,并给出注意力与 Mamba 两类内核的实测对比。

7月28日周二
7月26日周日
  1. Berkeley AI Research32

    Berkeley AI Research 提出 ABBEL:用信念状态监督 LLM 长程交互中的摘要更新

    Berkeley AI Research 提出 ABBEL 框架,将 LLM 的摘要内容以自然语言"信念状态"形式隔离并监督,通过受自编码器启发的信念评分机制提升长程交互效率。在协作编程基准 CollabBench 上,采用重建式信念评分的 ABBEL-rec-BG 将全上下文模型的性能差距缩小约 50%,训练步数从 100 降至 50,峰值 token 数也显著低于全上下文设置。

4月20日周一
  1. Berkeley AI Research40

    GRASP:面向世界模型的基于梯度的长时程规划器

    伯克利 AI 研究团队提出 GRASP,一种面向学习型世界模型的基于梯度的规划器,通过将轨迹提升到虚拟状态实现跨时间并行优化、在状态迭代上直接注入随机性以探索、并重塑梯度让动作获得清晰信号,从而让长时程规划变得可行。该方法针对长时程规划中梯度爆炸/消失、非贪心结构导致的局部极小值以及高维视觉模型带来的脆弱"状态-输入"梯度问题。

3月13日周五
1月10日周六
  1. Berkeley AI Research30

    伯克利提出信息驱动成像系统设计框架,登 NeurIPS 2025

    伯克利 AI Research 提出一套基于互信息的成像系统评估与优化框架,可直接从含噪测量中估计信息量,并在 NeurIPS 2025 论文中验证。该指标在彩色摄影、射电天文、无镜头成像和显微成像四个领域均能预测解码器性能,优化后设计可媲美端到端方法,且内存与算力需求更低、无需任务专用解码器。