跳到正文
今天10月9日周五1 条
10月8日周四
  1. Hugging Face Daily Papers32

    准确但不谦逊:知识冲突下 LLM 智能体的认知谦逊评估

    研究提出用认知谦逊(EH)评估 LLM 智能体在知识冲突下的表现,通过 Identify、Solve、Escalate(ISE)三个轨迹级行为维度,在受控冲突与多步执行中的自然冲突两种设定下评测四个智能体。结果显示更高任务准确率并不必然对应更强的认知谦逊:部分高准确率配置能识别冲突,却不在错误答案中传达未解决的不确定性。轨迹分析还发现智能体常在执行早期检测到冲突,却在后续步骤中未能维持或解决。

10月6日周二
  1. Google Research34

    Google 发布智能体隐私与安全研讨会报告:从上下文完整性视角看开放与新兴问题

    Google 发布《智能体隐私与安全中的开放与新兴问题:上下文视角》研讨会报告,汇集 50 多位学界与业界专家,于 2025 年底在纽约 Google CAPS 研讨会上完成。报告指出智能体因非结构化接口与输入歧义、概率性控制流、自主性与委派三大特性带来新挑战,主张以 Contextual Integrity 理论为基础,构建上下文策略引擎,在系统沙箱、模型推理和用户控制多层协同防护。

10月2日周五
  1. Google Research62

    Google 发布基于 TEE 的新一代联邦学习系统,Gboard 已采用

    Google 发布新一代联邦学习系统,用可信执行环境(TEE)为数据匿名化提供可验证、可审计的保证,Gboard 已采用该系统上线英语和日语下一词预测模型。新系统把客户端梯度计算移到服务端,训练时间瓶颈从设备可用性转为 TEE 资源,此前每个模型训练需 1-2 个月。

    推荐理由:Google 公布基于 TEE 的新一代联邦学习系统设计,并给出 Gboard 已上线的实际部署效果。

9月7日周一