论文研究 ·
多智能体代码评判可靠性:带拒答机制的无标签方法
When Is a Multi-Agent Code Judge Actually Grounded? Two Label-Free Measurements, and a Judge That Declines to Guess
66进行中1 条arXiv cs.AI
AI 解读
AI 生成推荐理由提升AI代码评审可信度,减少错误评判带来的开发风险。
提出无标签测量方法,可让多智能体代码评审在无依据时主动拒判
发生了什么
arXiv研究者针对多智能体代码评审易无依据输出确定结论的问题,对已公开的MARCH评审框架在两个代码评测基准上开展80组逐条件测量,发现该框架78%-95%的对比会判定两份代码质量相当,准确率仅4.4%,远低于单模型直接评审的43.7%。团队从流程日志提取两类无标签测量维度,对无判断依据的对比设置门槛过滤,让流程主动拒判这类无依据比较,过滤后准确率从20.7%提升至36.9%,仍可覆盖一半的对比任务。
关键信息
- 研究对象
- MARCH多智能体代码评审框架
- 核心问题表现
- 78%-95%的对比判定两代码等价,准确率仅4.4%
- 参照基线表现
- 单模型直接评审准确率达43.7%
- 优化后效果
- 过滤无依据对比后,准确率从20.7%升至36.9%,可完成半数对比
- 核心创新
- 无标签识别评审无判断依据的方法
背景
当前大模型开展代码评审时,即使缺乏判断依据也会输出带推理过程的确定结论,与有依据的判断难以区分。多智能体验证框架在文档检索类证据场景下验证效果较好,但在代码评审场景下原有适用条件已失效。
为什么重要
对代码评审行业而言,该无标签依据识别方法可降低智能评审的无效判断,提升评审结果的可信度;对开发者来说,可借助该过滤机制减少无意义的代码对比,提升研发效率;对普通用户而言,基于这类技术构建的代码工具输出可靠性将更高,可减少代码漏洞带来的使用风险。
由 AI 根据原文生成,可能有疏漏,以原文为准。