CAFÉ:机器遗忘的因果黑盒测试方法
研究者提出 CAFÉ,一种仅依赖已部署模型预测结果的机器遗忘黑盒测试方法,通过干预特征并将变化传播至下游特征,检测预测是否仍受目标特征影响。在两个因果网络基准、四种遗忘方法上,CAFÉ 以 0.92–0.93 的成对准确率对残余影响排序,现有检查最高仅 0.71。在真实人口普查数据上,CAFÉ 还发现了能通过重训练却未被直接输入检查察觉的残余影响。
研究者提出 CAFÉ,一种仅依赖已部署模型预测结果的机器遗忘黑盒测试方法,通过干预特征并将变化传播至下游特征,检测预测是否仍受目标特征影响。在两个因果网络基准、四种遗忘方法上,CAFÉ 以 0.92–0.93 的成对准确率对残余影响排序,现有检查最高仅 0.71。在真实人口普查数据上,CAFÉ 还发现了能通过重训练却未被直接输入检查察觉的残余影响。
研究提出在 Arm TrustZone 的 OP-TEE 中通过 WebAssembly Micro Runtime(WAMR)运行未经修改的 AI 模型,并配套一个加密 WebAssembly 二进制、将密钥存入设备熔丝的模型分发器,使只有 OP-TEE 中的 WAMR 可信应用能解密执行。