跳到正文
热点事件观察中

ViSkill:视觉原生技能强化VLM Agent

1 篇报道1 个报道来源2 天前更新

先了解这件事

AI 综述

浙江大学 ZJU-REAL 等作者发布论文,提出视觉原生技能学习框架 ViSkill:把成功交互编码为 VLM 智能体可直接调用的复合视觉技能卡,检索到的技能同时引导推理与奖励塑形,成功轨迹再蒸馏回技能库形成闭环。 据论文,在 Sokoban、FrozenLake 和 PrimitiveSkill 三个任务上,ViSkill 总体成功率达 0.89,加入冷启动初始化后升至 0.91,高于其对比的闭源与开源基线,收敛也快于标准 PPO。代码已在 GitHub 开源。

AI 根据报道生成 · 1 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月8日
  1. Hugging Face Daily Papers
    ViSkill:用可演进的视觉原生技能强化 VLM 智能体

    ViSkill 是一个视觉原生技能学习框架,将成功交互编码为 VLM 智能体可直接调用的复合视觉技能卡,检索到的技能同时引导推理与奖励塑形,成功轨迹再蒸馏回技能库形成闭环。在 Sokoban、FrozenLake 和 PrimitiveSkill 上,ViSkill 总体成功率达 0.89,加入冷启动初始化后升至 0.91,优于所有对比的闭源与开源基线,且收敛快于标准 PPO。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。