论文研究 ·
新论文提出系统综述筛选自动化的基准框架
A Benchmark Framework for Screening Automation in Systematic Reviews
69进行中1 条arXiv cs.CL
AI 解读
AI 生成推荐理由提升LLM在科研文献筛选场景下的评估可靠性。
研究团队推出SRBench基准与PromptSR工具,支撑系统综述的LLM筛选可信评估
发生了什么
研究团队针对循证研究中系统综述的文献筛选阶段耗时久、传统LLM评估指标在类别极不平衡场景下易失真的问题,搭建含45064条标注样本的基准数据集SRBench,覆盖32份经筛选的二级研究;配套推出适配类别不平衡特性的评估框架,以及支持提示试验、实验管理、结果分析的PromptSR工具,已完成典型场景的应用验证。
关键信息
- 核心数据集
- SRBench,含45064条标注样本、覆盖32份二级研究
- 配套工具
- PromptSR,支持LLM筛选的提示试验与结果分析
- 评估框架特性
- 适配系统综述筛选场景的类别不平衡特点
- 应用场景
- 循证研究的系统综述文献筛选环节
背景
系统综述是循证研究的核心基础,其文献筛选环节需要投入大量人力逐篇判断内容相关性,LLM虽能大幅降低这部分工作量,但现有评估方法多采用传统通用指标,难以适配该场景下绝大多数文献被排除的不平衡数据特点。
为什么重要
这套专门针对系统综述筛选场景搭建的基准与配套工具,解决了此前LLM在该垂直场景下缺乏可信评估标尺的问题,可帮研究人员更高效地调试适配的LLM筛选提示,减少无意义的人力投入;最终能加速循证研究的产出效率,为各依赖系统综述的领域提供更可靠的证据生产支撑。
后续看点
可关注该基准与PromptSR工具的开源进展,以及不同主流LLM在这套评测下的实际表现差异。
由 AI 根据原文生成,可能有疏漏,以原文为准。