混合模态检索器中的模态偏好:文本中的混沌
研究发现密集检索器性能对模态组成高度敏感:当图像文档被语义对应的文本逐步替换时,检索性能呈明显 V 型曲线,单模态语料表现强劲,模态共存时显著下降。无关文本比等量无关图像造成更严重的性能退化,研究者称之为"文本中的混沌",其根源是文本表示获得系统性更高的相似度分数。
研究发现密集检索器性能对模态组成高度敏感:当图像文档被语义对应的文本逐步替换时,检索性能呈明显 V 型曲线,单模态语料表现强劲,模态共存时显著下降。无关文本比等量无关图像造成更严重的性能退化,研究者称之为"文本中的混沌",其根源是文本表示获得系统性更高的相似度分数。
研究者推出 Learn2Play Bench,用规则新颖或反直觉的文本游戏评测 LLM 智能体的经验学习能力,游戏提供可复现反馈与自动评分,并变换实例测试知识迁移。评测 backbone 模型、自进化方法和 agent harness 后发现:保留完整动作与反馈记录比总结成规则更利于学习;顶尖人类玩家峰值分数高于受测智能体;固定 backbone 时更换 harness 可提升表现并降低推理成本。
ViSkill 是一个视觉原生技能学习框架,将成功交互编码为 VLM 智能体可直接调用的复合视觉技能卡,检索到的技能同时引导推理与奖励塑形,成功轨迹再蒸馏回技能库形成闭环。在 Sokoban、FrozenLake 和 PrimitiveSkill 上,ViSkill 总体成功率达 0.89,加入冷启动初始化后升至 0.91,优于所有对比的闭源与开源基线,且收敛快于标准 PPO。
OneSearch-VL 是一个以视觉锚定证据图(VGEG)为核心的多模态深度研究智能体,统一处理单图、多图和视频研究任务。其 8B 版本在新建的 OneSearch-MI-Bench 和 OneSearch-Video-Bench 上分别比带工具访问的 Qwen3-VL-8B 提升 20.2 和 17.6 个百分点,并在 7 个图像基准和 VideoDR 上取得显著增益。
Google 发布 Agent Development Kit(ADK)for Kotlin 1.0 正式版,与 ADK 1.0 Core 功能对齐,并加入 Android 优先的端侧扩展。
推荐理由:官方给出 1.0 的功能清单与 Android 端侧扩展,可据此判断 Kotlin 智能体开发的可用边界。