跳到正文
热点事件观察中

MARGIN多智能体运行时置信度校准方法发布

1 篇报道1 个报道来源2 天前更新

先了解这件事

AI 综述

论文作者发布 MARGIN(Multi-Agent Runtime Grading via Incremental Normalisation),一种面向多智能体基础模型协调的运行时置信度校准方法。该方法通过置信度分带内近期准确率与自报置信度的比值,学习各模型专属的置信度修正,无需重训模型或预留校准集。 在 18 模型池的代码生成、问答与数学评测中,其偏移后期望校准误差在两项代码生成迁移上优于全部五个在线校准基线,问答迁移上优于四个;代码生成协调实验中,答案选择准确率相比未校准的置信度加权提升 4.3 和 14.0 个百分点。

AI 根据报道生成 · 1 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月8日
  1. Hugging Face Daily Papers
    MARGIN:面向多智能体基础模型协调的运行时置信度校准

    MARGIN 是一种运行时校准方法,通过置信度分带内近期准确率与自报置信度的比值,学习各模型专属的置信度修正,无需重训模型或预留校准集。在 18 模型池的代码生成、问答与数学评测中,其偏移后期望校准误差在两项代码生成迁移上优于全部五个在线校准基线,问答迁移上优于四个;代码生成协调实验中,答案选择准确率相比未校准的置信度加权提升 4.3 和 14.0 个百分点。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。