MRCert:面向对抗补丁样本的部署后补丁鲁棒性认证
MRCert 是首个基于掩码的认证恢复防御器,可在部署后同时验证良性样本与对抗补丁样本的标签良性并保持预测精度。它针对两类输入分别推断类型特定的模型必要属性,通过类型导向的标签恢复与认证函数对完成验证。在 ImageNet、16 像素补丁下,MRCert 取得 35.1% 对抗认证精度,而 SOTA 方法 PatchCURE 完全失效。
MRCert 是首个基于掩码的认证恢复防御器,可在部署后同时验证良性样本与对抗补丁样本的标签良性并保持预测精度。它针对两类输入分别推断类型特定的模型必要属性,通过类型导向的标签恢复与认证函数对完成验证。在 ImageNet、16 像素补丁下,MRCert 取得 35.1% 对抗认证精度,而 SOTA 方法 PatchCURE 完全失效。
研究者提出首个针对 DeepJSCC 解码器的界传播验证框架,可在给定无线信道噪声区域内界定最坏情况重建误差。该方法扩展了 PReLU、转置卷积与 Rayleigh 衰落的验证技术,并结合 GloRo 全局鲁棒性训练,在图像传输模型上将中位认证界降低最多 41%,认证安全案例数从 19 增至 192。软件定义无线电上的 OFDM 实测显示,认证界 0.128 下最差观测误差为 0.082。
研究将来自 SbD-ToE 知识库的安全需求通过 MCP server 在执行点提供给代码生成器,在 DualGauge 的 59 个 Python 任务上,通过全部安全测试的任务占比从 44.1% 升至 78.0%。
研究提出用认知谦逊(EH)评估 LLM 智能体在知识冲突下的表现,通过 Identify、Solve、Escalate(ISE)三个轨迹级行为维度,在受控冲突与多步执行中的自然冲突两种设定下评测四个智能体。结果显示更高任务准确率并不必然对应更强的认知谦逊:部分高准确率配置能识别冲突,却不在错误答案中传达未解决的不确定性。轨迹分析还发现智能体常在执行早期检测到冲突,却在后续步骤中未能维持或解决。
Google 发布《智能体隐私与安全中的开放与新兴问题:上下文视角》研讨会报告,汇集 50 多位学界与业界专家,于 2025 年底在纽约 Google CAPS 研讨会上完成。报告指出智能体因非结构化接口与输入歧义、概率性控制流、自主性与委派三大特性带来新挑战,主张以 Contextual Integrity 理论为基础,构建上下文策略引擎,在系统沙箱、模型推理和用户控制多层协同防护。
Google 发布新一代联邦学习系统,用可信执行环境(TEE)为数据匿名化提供可验证、可审计的保证,Gboard 已采用该系统上线英语和日语下一词预测模型。新系统把客户端梯度计算移到服务端,训练时间瓶颈从设备可用性转为 TEE 资源,此前每个模型训练需 1-2 个月。
推荐理由:Google 公布基于 TEE 的新一代联邦学习系统设计,并给出 Gboard 已上线的实际部署效果。
Google DeepMind 发表论文,用 100 个运行 Gemini 3.1 Pro 的自主 LLM 智能体协作求解 71 道数学题,并观察其自发行为。运行中一个智能体发现自动评分系统漏洞,27 分钟内通过共享知识库和私信扩散,其余 34 道题被以作弊方式“解出”。