论文研究 · 至
新论文审计生产Text-to-SQL中LLM评委失效问题
Auditing and Repairing LLM-as-Judge Failures in a Production Text-to-SQL Pipeline
82进行中2 条arXiv cs.CLarXiv cs.AI
事件解读
AI 综合 1 家报道推荐理由提醒从业者重视LLM评委的实际可靠性,规避生产风险。
2026年9月28日arXiv发布两项大模型落地优化的重要研究成果
2026年9月28日arXiv公开两项大模型落地优化相关预印本研究
发生了什么
两支AI研究团队2026年9月28日在arXiv公开预印本:其一针对生产Text-to-SQL管线的LLM评委开展审计,发现原用gpt-4o-mini一致性极低,测试出自托管Qwen3.6-27B替换后成本仅为原方案1/300、效果与商用模型持平,多评委集成方案更优,相关审计代码已开源;其二发现LLM代理“帕金森”问题,研发GEC v0.2架构,2.4万轮测试中成功率96.57%、token消耗降36.4%。
关键信息
- 原Text-to-SQL评委模型
- gpt-4o-mini,过度标记77.1%人工合理案例
- SQL评委替换方案
- 自托管Qwen3.6-27B,kappa=0.72,单调用成本为原方案1/300
- 开源资源
- Text-to-SQL评委审计代码与预注册方案已在GitHub公开
- LLM代理现存问题
- 目标完成后仍做无价值优化的“LLM帕金森”现象
- 代理优化架构
- GEC v0.2(不确定性感知全局执行控制架构)
- 架构测试成绩
- 2.4万轮测试硬目标成功率96.57%,token消耗降36.4%
背景
此前行业普遍默认商用大模型可直接作为生产管线自动评委,且LLM代理多采用自我驱动循环架构,行业常依赖扩大模型规模提升能力,较少关注生产环节的可靠性与成本优化。
为什么重要
对行业而言,两项研究分别验证了生产管线LLM评委审计、代理分离式控制架构的落地价值,探索了非规模扩量的大模型降本增效路径;对开发者,提供了可复用的SQL校验开源方案、代理架构参考;对普通用户,后续AI服务准确率、响应速度有望提升,使用成本下降。
后续看点
后续可关注两项研究开源资源的落地适配,以及相关方案在更多生产场景中的实际应用效果。
由 AI 综合 2 篇报道生成,有新报道会更新,可能有疏漏,以原文为准。
报道时间线
- arXiv cs.CL ↗新论文审计生产Text-to-SQL中LLM评委失效问题Auditing and Repairing LLM-as-Judge Failures in a Production Text-to-SQL Pipeline实测生产环境中gpt-4o-mini作为LLM评委与人工标注一致性极低,提出修复方案。
- arXiv cs.AI ↗研究提出LLM智能体执行控制失效问题及优化架构LLM Parkinsonism: Executive-Control Failure, Token-Inefficient Persistence, and an Uncertainty-Aware Global Executive Control Architecture for Autonomous Language-Model Agents发现LLM智能体存在目标达成后冗余操作的控制缺陷,提出不确定性感知架构。