Google 与 BIDMC 研究登上《柳叶刀》:AI 聊天机器人 AMIE 用于就诊前评估
Google 与贝斯以色列女执事医疗中心(BIDMC)研究人员主导的一项研究发表于《柳叶刀》主刊,这是 Google 研究成果首次登上该刊。在 BIDMC 门诊初级保健诊所的真实临床研究中,98 名患者在急诊就诊前使用了 Google 研究级诊断 AI 聊天机器人 AMIE,医生实时监控全部交互,按预设安全标准没有任何一轮对话需要中断。
Google 与贝斯以色列女执事医疗中心(BIDMC)研究人员主导的一项研究发表于《柳叶刀》主刊,这是 Google 研究成果首次登上该刊。在 BIDMC 门诊初级保健诊所的真实临床研究中,98 名患者在急诊就诊前使用了 Google 研究级诊断 AI 聊天机器人 AMIE,医生实时监控全部交互,按预设安全标准没有任何一轮对话需要中断。
字节 Seed 团队发现 DeepSeek-V4 系列的长上下文检索准确率会随信息在输入中的位置以 4 个 Token 为周期波动,128K 大海捞针测试中同一信息换位置最大差距达 40.2 个百分点。
VibeEdit 提出一种图像编辑新界面,用户直接在图像上放置空间标记并附简短注释,形成"画布指令"来指定编辑位置和内容,无需单独输入文本提示词,即可完成对象添加、删除、替换、属性修改和移动。
DreamTrue 是一个多视角、跨本体的机器人世界模型,可实现动作忠实且物理合理的视频预测。它通过将动作轨迹渲染为图像空间条件并引入离线几何校准来提升动作跟随能力,同时用反事实后训练扩展交互覆盖范围。
针对 N-version 目标检测,研究者提出 Cov_OD 和 Cer_OD 两项可靠性度量,可直接从各模型或输入帧的单独检测结果计算,无需依赖投票策略。现有 mAP、Accuracy 等指标只反映聚合后的最终结果,无法刻画多检测结果间的多样性与一致性。在自动驾驶模拟器的车辆案例中,这两项指标可用于筛选误差特性互补的版本组合、依据多样性与一致性选择投票策略,并通过两两版本分析指导系统增量构建。
研究针对基于 LLM 的代码生成中"错误程序却表现出与正确程序相当的 token 级置信度"这一过度自信困境,在四个开源代码模型和三个基于执行的基准上展开分析。结果显示,现有不确定性信号仅提供部分且依赖模型的执行失败证据,过度自信在程序级和 token 级均持续存在,基于不确定性的选择无法稳定提升接受集准确率。指令微调会提高失败生成的确定性却不改善正确性判别,常见缓解手段也无法可靠解决该失败模式。