ViSkill:视觉原生技能强化VLM Agent
热点事件观察中
ViSkill:视觉原生技能强化VLM Agent
1 篇报道1 个报道来源2 天前更新
先了解这件事
AI 综述
浙江大学 ZJU-REAL 等作者发布论文,提出视觉原生技能学习框架 ViSkill:把成功交互编码为 VLM 智能体可直接调用的复合视觉技能卡,检索到的技能同时引导推理与奖励塑形,成功轨迹再蒸馏回技能库形成闭环。 据论文,在 Sokoban、FrozenLake 和 PrimitiveSkill 三个任务上,ViSkill 总体成功率达 0.89,加入冷启动初始化后升至 0.91,高于其对比的闭源与开源基线,收敛也快于标准 PPO。代码已在 GitHub 开源。
AI 根据报道生成 · 1 小时前更新
最新进展10月8日 04:00
ViSkill:用可演进的视觉原生技能强化 VLM 智能体报道时间线
沿着报道,了解事件的不同侧面。
10月8日
- Hugging Face Daily PapersViSkill:用可演进的视觉原生技能强化 VLM 智能体
ViSkill 是一个视觉原生技能学习框架,将成功交互编码为 VLM 智能体可直接调用的复合视觉技能卡,检索到的技能同时引导推理与奖励塑形,成功轨迹再蒸馏回技能库形成闭环。在 Sokoban、FrozenLake 和 PrimitiveSkill 上,ViSkill 总体成功率达 0.89,加入冷启动初始化后升至 0.91,优于所有对比的闭源与开源基线,且收敛快于标准 PPO。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。