Hugging Face Daily Papers·· 2 天前AI 评分34
MARGIN:面向多智能体基础模型协调的运行时置信度校准
MARGIN: Runtime Confidence Calibration for Multi-Agent Foundation Model Coordination
AI 导读
MARGIN 是一种运行时校准方法,通过置信度分带内近期准确率与自报置信度的比值,学习各模型专属的置信度修正,无需重训模型或预留校准集。在 18 模型池的代码生成、问答与数学评测中,其偏移后期望校准误差在两项代码生成迁移上优于全部五个在线校准基线,问答迁移上优于四个;代码生成协调实验中,答案选择准确率相比未校准的置信度加权提升 4.3 和 14.0 个百分点。
来源:Hugging Face Daily Papers · huggingface.co