论文研究 · 至

新论文审计生产Text-to-SQL中LLM评委失效问题

Auditing and Repairing LLM-as-Judge Failures in a Production Text-to-SQL Pipeline

82进行中2 条arXiv cs.CLarXiv cs.AI

事件解读

AI 综合 1 家报道

推荐理由提醒从业者重视LLM评委的实际可靠性,规避生产风险。

2026年9月28日arXiv发布两项大模型落地优化的重要研究成果

2026年9月28日arXiv公开两项大模型落地优化相关预印本研究

发生了什么

两支AI研究团队2026年9月28日在arXiv公开预印本:其一针对生产Text-to-SQL管线的LLM评委开展审计,发现原用gpt-4o-mini一致性极低,测试出自托管Qwen3.6-27B替换后成本仅为原方案1/300、效果与商用模型持平,多评委集成方案更优,相关审计代码已开源;其二发现LLM代理“帕金森”问题,研发GEC v0.2架构,2.4万轮测试中成功率96.57%、token消耗降36.4%。

关键信息

原Text-to-SQL评委模型
gpt-4o-mini,过度标记77.1%人工合理案例
SQL评委替换方案
自托管Qwen3.6-27B,kappa=0.72,单调用成本为原方案1/300
开源资源
Text-to-SQL评委审计代码与预注册方案已在GitHub公开
LLM代理现存问题
目标完成后仍做无价值优化的“LLM帕金森”现象
代理优化架构
GEC v0.2(不确定性感知全局执行控制架构)
架构测试成绩
2.4万轮测试硬目标成功率96.57%,token消耗降36.4%

背景

此前行业普遍默认商用大模型可直接作为生产管线自动评委,且LLM代理多采用自我驱动循环架构,行业常依赖扩大模型规模提升能力,较少关注生产环节的可靠性与成本优化。

为什么重要

对行业而言,两项研究分别验证了生产管线LLM评委审计、代理分离式控制架构的落地价值,探索了非规模扩量的大模型降本增效路径;对开发者,提供了可复用的SQL校验开源方案、代理架构参考;对普通用户,后续AI服务准确率、响应速度有望提升,使用成本下降。

后续看点

后续可关注两项研究开源资源的落地适配,以及相关方案在更多生产场景中的实际应用效果。

由 AI 综合 2 篇报道生成,有新报道会更新,可能有疏漏,以原文为准。

报道时间线

  1. arXiv cs.CL ↗新论文审计生产Text-to-SQL中LLM评委失效问题Auditing and Repairing LLM-as-Judge Failures in a Production Text-to-SQL Pipeline实测生产环境中gpt-4o-mini作为LLM评委与人工标注一致性极低,提出修复方案。
  2. arXiv cs.AI ↗研究提出LLM智能体执行控制失效问题及优化架构LLM Parkinsonism: Executive-Control Failure, Token-Inefficient Persistence, and an Uncertainty-Aware Global Executive Control Architecture for Autonomous Language-Model Agents发现LLM智能体存在目标达成后冗余操作的控制缺陷,提出不确定性感知架构。
返回 AI 热点