跳到正文
热点事件观察中

WorldGuide 发布闭环视频世界模型

1 篇报道1 个报道来源2 天前更新

先了解这件事

AI 综述

论文作者发布 WorldGuide,将流程视频生成建模为视觉世界空间中的闭环任务执行:模型仅凭初始图像和任务目标,即可预测原子动作、生成对应视频片段,并据此选择下一步动作或终止。作者称,其 Planner 与 Executor 基于同一步级流程演示训练,并配合分层视觉记忆控制长程执行的历史 token 开销。作者同时开源了模型与 WorldGuide Bench。

AI 根据报道生成 · 1 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月8日
  1. Hugging Face Daily Papers
    WorldGuide:面向流程任务执行的目标导向视频世界模型

    WorldGuide 将流程视频生成建模为视觉世界空间中的闭环任务执行,仅凭初始图像和任务目标即可预测原子动作、生成对应视频片段,并据此选择下一步动作或终止。其 Planner 与 Executor 基于同一步级流程演示训练,配合分层视觉记忆控制长程执行的历史 token 开销。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。