USDCraft:基于几何约束的程序化建模生成铰接式 3D 资产用于仿真
USDCraft 提出将铰接式资产重建转化为基于部分几何证据的程序化建模,由预训练 LLM 编写并修订可执行程序,无需任务特定训练即可生成仿真就绪的铰接式资产。
USDCraft 提出将铰接式资产重建转化为基于部分几何证据的程序化建模,由预训练 LLM 编写并修订可执行程序,无需任务特定训练即可生成仿真就绪的铰接式资产。
研究发现密集检索器性能对模态组成高度敏感:当图像文档被语义对应的文本逐步替换时,检索性能呈明显 V 型曲线,单模态语料表现强劲,模态共存时显著下降。无关文本比等量无关图像造成更严重的性能退化,研究者称之为"文本中的混沌",其根源是文本表示获得系统性更高的相似度分数。
研究者提出 Spatial Canvas Interface,让用户通过语义、身份、文本、像素四类绑定在空间中直接编排海报生成意图,并据此开发了海报生成模型 Compo。Compo 由预训练图像编辑模型适配而来,支持用户手动构建画布的直接推理和自动规划画布的 agentic 模式,无需从零训练专用海报生成器。实验显示其构图可控性强于通用图像生成模型和专用海报生成系统,同时保持高视觉质量。
VibeEdit 提出一种图像编辑新界面,用户直接在图像上放置空间标记并附简短注释,形成"画布指令"来指定编辑位置和内容,无需单独输入文本提示词,即可完成对象添加、删除、替换、属性修改和移动。
研究者推出 RISEBench++,一个面向推理驱动视觉编辑(RISE)的基准,涵盖 Temporal、Causal、Spatial、Logical、Counterfactual 与 Hybrid 六类推理维度,细分为 12 个子类和 65 种任务类型,含 1000 条中英双语人工标注测试用例。
研究者提出循环原生残差连接 InfiLoop,让循环 Transformer 在迭代次数增长时不再性能退化,它通过内容加权与学习式时间衰减维护循环状态的持续摘要,并以精确流式递归保持聚合内存恒定。
LEGO 提出一种无需 lifting 的第三人称到第一人称视频生成方法,用 LVSM 风格的 Transformer 直接渲染第一人称视角,省去深度估计、点云和重投影步骤。该合成器输出逐区域置信度,用于遮蔽低置信区域并在去噪早期引导生成器布局,性能持续优于现有显式流程,且无需重训练即可泛化到其他数据集。
SpatialOPSD 是一个 on-policy 自蒸馏框架,将空间编码智能体已验证的执行轨迹作为特权信息,把空间推理能力内化进独立 MLLM,使其无需外部工具即可运行。
DreamTrue 是一个多视角、跨本体的机器人世界模型,可实现动作忠实且物理合理的视频预测。它通过将动作轨迹渲染为图像空间条件并引入离线几何校准来提升动作跟随能力,同时用反事实后训练扩展交互覆盖范围。
研究者推出 SpaceCast-Bench,首个直接诊断预测性空间推理的基准,基于 observe-transform-infer 框架,从 182 个真实场景构建 3,862 道题,覆盖静态感知、局部预测与全局预测三个层级共 16 种任务。
针对视觉语言模型空间推理弱、RGB 输入缺乏几何证据的问题,研究者提出 GPD(Geometry-Privileged Distillation),将深度、语义和鸟瞰图(BEV)线索渲染为紧凑文本并按问题路由给教师模型,仅对错误轨迹施加特权 KL 以增强 GRPO,部署模型仍只用 RGB。
OuroWorld 是一个无需掩码的框架,可将任意静态 3D Gaussian Splatting 场景转化为从任意视角无缝循环的 3D 动态摄影。它用视觉语言模型推断动态并引导视频模型合成参考视频,再通过 Inconsistency-Robust Periodic 4DGS 完成多视角视频重建。在 39 个场景上,OuroWorld 在用户研究中赢得 70.8%-99.0% 的对比。
MiMo-V2.6 系列是一套全模态模型家族,通过扩展强化学习算力推进模型智能。其 RL 扩展沿三个方向进行:每步消耗 1,568 个样本、2.7-3.7B tokens,上下文长度最高 1M;环境覆盖代码、通用、视觉与网络领域;并采用分组式智能体评分提供更准确的奖励信号。团队冻结 MoE 路由器并建立多层防御以抑制奖励攻击,同时开源训练动态、RL 环境与 RL 框架。
推荐理由:报告公开了 MiMo-V2.6 的 RL 训练动态、环境与框架,可供研究大规模强化学习与自我改进的读者参考复现。
MRCert 是首个基于掩码的认证恢复防御器,可在部署后同时验证良性样本与对抗补丁样本的标签良性并保持预测精度。它针对两类输入分别推断类型特定的模型必要属性,通过类型导向的标签恢复与认证函数对完成验证。在 ImageNet、16 像素补丁下,MRCert 取得 35.1% 对抗认证精度,而 SOTA 方法 PatchCURE 完全失效。
针对 N-version 目标检测,研究者提出 Cov_OD 和 Cer_OD 两项可靠性度量,可直接从各模型或输入帧的单独检测结果计算,无需依赖投票策略。现有 mAP、Accuracy 等指标只反映聚合后的最终结果,无法刻画多检测结果间的多样性与一致性。在自动驾驶模拟器的车辆案例中,这两项指标可用于筛选误差特性互补的版本组合、依据多样性与一致性选择投票策略,并通过两两版本分析指导系统增量构建。
研究者提出首个针对 DeepJSCC 解码器的界传播验证框架,可在给定无线信道噪声区域内界定最坏情况重建误差。该方法扩展了 PReLU、转置卷积与 Rayleigh 衰落的验证技术,并结合 GloRo 全局鲁棒性训练,在图像传输模型上将中位认证界降低最多 41%,认证安全案例数从 19 增至 192。软件定义无线电上的 OFDM 实测显示,认证界 0.128 下最差观测误差为 0.082。
研究将来自 SbD-ToE 知识库的安全需求通过 MCP server 在执行点提供给代码生成器,在 DualGauge 的 59 个 Python 任务上,通过全部安全测试的任务占比从 44.1% 升至 78.0%。
研究者提出 CABRA 编程能力评估基准,以调用图变换从零构建任务,并按函数遍历、搜索、运行时解析、指令遵循四个维度用任务规模参数调节难度。
研究者提出 TestJack,一个超越固定单元测试的补丁评估框架:针对每个 trial 生成覆盖提示词要求的测试,只保留真实补丁能通过的测试,并重新检查失败样本,使每个确认的失败都有可复现测试支撑。
研究基于 SESR-Eval 基准及新构建的 SESR-Eval-Mini 数据集,评估了八款新 LLM 在软件工程系统综述筛选任务上的表现,平均 MCC 仅从旧模型的 0.347 微升至 0.365。
研究团队构建了统一数据集与评估框架,用于整体评估 LLM 形式化规范生成(SpecGen),数据集包含 350 个 Lean 任务,其中 189 个来自 VERINA、161 个来自 CLEVER,覆盖形式有效性、参考相似性与等价性、行为充分性。
Agent4RE 是一个自精炼多智能体需求工程(RE)系统,通过编排专用智能体并引入两个迭代改进循环,实现从需求获取到生成的端到端流程。团队同时构建了基于真实人工需求规格的 RE-E2E 数据集,并提出加入自主自精炼或结构化人工反馈的两个增强版本。
研究评估了 13 个 LLM 在代码追踪问题上生成、求解、模拟和诊断新手编程错误概念的能力。前沿模型能可靠完成这些任务,但 ≤14B 的小模型在动态执行上表现吃力,代码微调模型在错误概念模拟时会退回正确执行。错误概念诊断在 True/False 格式下显著比开放式生成任务更容易。
星动纪元自研世界动作模型VPP2登顶RoboDojo仿真榜单,综合平均成功率32.26%、平均得分39.26分,两项指标均列第一,领先GPT-6-Astra的22.48%和28.97分。
MirroS 团队发布 AgentGarten,把可执行代码环境与实时神经渲染器连接,代码定义物理规则、模型生成视觉反馈,以超过 30 fps 的吞吐让智能体持续交互。
Google Research 在 NBER 发布一项为期三个月的专利撰写实地实验,将当时未发布的 Google Labs AI 专利写作助手(现属 Gemini Notebook)随机开放给 11 家知识产权律所的 133 名律师,其中三分之二获得早期访问权。
推荐理由:三个月专利撰写实验区分了 AI 带来的即时产出提升与无辅助判断力的变化,为理解 AI 对专业能力的影响提供了实证。
OmniCapBench 将音视频描述评估重构为深度结构化诊断框架,把预测目标从自由文本转为实体引用、视觉镜头和音频事件三类原子化可验证评估单元,并基于 786 段密集标注视频进行确定性约束检查与局部 LLM 语义比较。评测前沿 MLLM 显示其局部感知较强,但长时程音视频推理薄弱,尤其存在身份漂移与跨模态错位问题。
研究提出用认知谦逊(EH)评估 LLM 智能体在知识冲突下的表现,通过 Identify、Solve、Escalate(ISE)三个轨迹级行为维度,在受控冲突与多步执行中的自然冲突两种设定下评测四个智能体。结果显示更高任务准确率并不必然对应更强的认知谦逊:部分高准确率配置能识别冲突,却不在错误答案中传达未解决的不确定性。轨迹分析还发现智能体常在执行早期检测到冲突,却在后续步骤中未能维持或解决。
研究者提出 BrickBench,一个面向智能体文本条件 LEGO 套装设计的基准,要求智能体从离散零件库中选件并同时推理局部与全局约束,产出满足语义与设计标准且可实际拼装的方案。配套环境 BrickAgent 让编程智能体构建、检查并验证设计,评测覆盖三种规模与零件可用性设置,从有效性、对齐度和设计三方面打分。结果显示领先智能体基本满足可验证的物理与语义要求,但仍不及人类设计。
研究者提出 Code-Only-as-Policy(COAP),用代码从相机图像和本体感知中测量并跟踪机器人、环境与任务状态,所有决策均由代码完成,测试时无需 VLM 或 VLA 参与。
英伟达团队基于 Nemotron 3,用监督微调、强化学习和反馈驱动的推理流程,在 IOI 2026 和 IMO 2026 两项竞赛中均达到金牌水平。
推荐理由:原文公开了从 Nemotron 3 微调到 IOI、IMO 金牌级成绩的完整配方与数据集,可据此复现领域专家模型的训练与推理流程。
Google Earth AI 的 Population Dynamics Foundation Model(PDFM)将匿名搜索趋势、人口流动、建成环境密度和环境数据压缩为按月更新的位置嵌入向量,无需任务微调即可直接接入现有流行病学模型。
Google 发布《智能体隐私与安全中的开放与新兴问题:上下文视角》研讨会报告,汇集 50 多位学界与业界专家,于 2025 年底在纽约 Google CAPS 研讨会上完成。报告指出智能体因非结构化接口与输入歧义、概率性控制流、自主性与委派三大特性带来新挑战,主张以 Contextual Integrity 理论为基础,构建上下文策略引擎,在系统沙箱、模型推理和用户控制多层协同防护。
GitHub 发布 ReviewBench,一个面向 AI 代码审查智能体的开放离线基准,基于 1.039 亿个 GitHub pull request 的分布特征构建,包含来自 187 个开源仓库、19 种语言的 219 个 pull request。
MIT Technology Review 对 300 名数据与 AI 高管的调研显示,企业平均仅约 34% 的智能体 AI 项目能进入生产环境,知识、上下文缺失与遗留数据系统、安全隐私顾虑是主要失败点。
针对扩散 Transformer 长序列生成中稀疏注意力导致质量下降的问题,研究者提出免训练框架 MC-Sparse,通过缓存查询分组、KV 索引与稠密-稀疏注意力残差并在去噪步骤间复用,实现更高保真度。在 Minimax-H3-Base 上取得 1.80 倍去噪加速,3D 资产生成上达 2.32 倍,质量损失可忽略。
微软 Copilot Studio 团队与 Hugging Face 联合发布 ThinkingBox,它让智能体在隔离的 MCP 工具会话中运行,只根据最终后端状态和副作用打分,而不是看模型生成的文字。
推荐理由:微软与 Hugging Face 联合发布的智能体评测基准,用数据库终态而非模型自述来判定成败,并给出 20 次重复下的可靠性数据。
一项受控研究用双人石头剪刀布和单人随机 n-gram 续写任务,测试 LLM 能否识别潜在策略、遵循简单马尔可夫规则并维持高阶条件依赖。结果显示更长的上下文并不能提升识别能力,正确识别也不保证忠实模拟,高阶依赖会显著削弱规则恢复,表面行为保真可能掩盖错误的生成机制。
Google 发布新一代联邦学习系统,用可信执行环境(TEE)为数据匿名化提供可验证、可审计的保证,Gboard 已采用该系统上线英语和日语下一词预测模型。新系统把客户端梯度计算移到服务端,训练时间瓶颈从设备可用性转为 TEE 资源,此前每个模型训练需 1-2 个月。
推荐理由:Google 公布基于 TEE 的新一代联邦学习系统设计,并给出 Gboard 已上线的实际部署效果。
ServiceNow CoreAI 构建了 AutoSynthData,利用目标模型的失败案例与更强教师的成功示范,自动生成并验证新的可执行训练任务,并随模型进步动态调整课程。该流程以 EnterpriseOps Gym 数据集为例演示,生成的任务需满足可行性、真实性与难度三项要求,验证器则需保证一致性、可靠性与完整性。