论文研究 ·

新论文提出系统综述筛选自动化的基准框架

A Benchmark Framework for Screening Automation in Systematic Reviews

69进行中1 条arXiv cs.CL

AI 解读

AI 生成

推荐理由提升LLM在科研文献筛选场景下的评估可靠性。

研究团队推出SRBench基准与PromptSR工具,支撑系统综述的LLM筛选可信评估

发生了什么

研究团队针对循证研究中系统综述的文献筛选阶段耗时久、传统LLM评估指标在类别极不平衡场景下易失真的问题,搭建含45064条标注样本的基准数据集SRBench,覆盖32份经筛选的二级研究;配套推出适配类别不平衡特性的评估框架,以及支持提示试验、实验管理、结果分析的PromptSR工具,已完成典型场景的应用验证。

关键信息

核心数据集
SRBench,含45064条标注样本、覆盖32份二级研究
配套工具
PromptSR,支持LLM筛选的提示试验与结果分析
评估框架特性
适配系统综述筛选场景的类别不平衡特点
应用场景
循证研究的系统综述文献筛选环节

背景

系统综述是循证研究的核心基础,其文献筛选环节需要投入大量人力逐篇判断内容相关性,LLM虽能大幅降低这部分工作量,但现有评估方法多采用传统通用指标,难以适配该场景下绝大多数文献被排除的不平衡数据特点。

为什么重要

这套专门针对系统综述筛选场景搭建的基准与配套工具,解决了此前LLM在该垂直场景下缺乏可信评估标尺的问题,可帮研究人员更高效地调试适配的LLM筛选提示,减少无意义的人力投入;最终能加速循证研究的产出效率,为各依赖系统综述的领域提供更可靠的证据生产支撑。

后续看点

可关注该基准与PromptSR工具的开源进展,以及不同主流LLM在这套评测下的实际表现差异。

由 AI 根据原文生成,可能有疏漏,以原文为准。

来源

  1. arXiv cs.CL ↗新论文提出系统综述筛选自动化的基准框架A Benchmark Framework for Screening Automation in Systematic Reviews针对LLM辅助系统综述文献筛选的评估问题,提出新基准弥补传统指标不足。
返回 AI 热点