论文研究 · 至
ORCA:评估大模型数据科学代码跨库转换能力的基准
ORCA: Evaluating LLMs on Data Science Code Translation
76进行中2 家报道 · 2 条arXiv cs.AIHF Daily Papers
事件解读
AI 综合 2 家报道推荐理由帮助开发者准确评估大模型的跨库代码互操作能力。
ORCA评测基准发布,填补大模型数据科学代码跨库翻译评测空白
HF Daily Papers刊发关于伊斯兰伦理转化为LLM对齐数据构建方法的论文
发生了什么
针对大模型数据科学代码跨库翻译评测研究不足的问题,研究团队构建了含1600个细粒度任务、200个全项目级任务的ORCA综合评测基准,配套参考译文与功能验证用例且经多阶段质量核验;测试显示前沿模型Claude-Opus-4.6在两类任务上的翻译成功率分别为56.92%、33.67%,其提出的意图增强翻译方法可分别带来4.80%、5.33%的绝对成功率增益。
关键信息
- 发布方
- 研究团队(2026年9月28日arXiv cs.AI公开)
- 产品
- ORCA数据科学代码翻译综合评测基准
- 参数规模/构成
- ORCA-MAIN含1600个细粒度任务,ORCA-PROJECT含200个全项目级任务
- 上线时间
- 2026年9月28日
- 基准成绩
- Claude-Opus-4.6在两个子任务集翻译成功率分别为56.92%、33.67%
- 方法增益
- 意图增强法使两个子任务集成功率分别提升4.80%、5.33%
背景
当前大模型在数据科学代码跨库翻译(需保持功能等价、实现生态互通)领域的专项评测存在明显研究缺口,尚无成熟的统一评测体系。
为什么重要
对行业而言,ORCA填补了数据科学代码翻译方向的评测空白,可精准定位大模型跨生态代码适配的能力短板;对开发者而言,该基准可帮助其选型适配多库迁移需求的大模型工具,意图增强优化思路也可直接落地到日常翻译工具中;对普通用户而言,跨库代码翻译能力的提升能够有效降低多数据科学生态的使用门槛。
后续看点
后续值得关注各前沿大模型在ORCA基准上的迭代表现,及意图增强方法的落地应用进展。
由 AI 综合 2 篇报道生成,有新报道会更新,可能有疏漏,以原文为准。
报道时间线
交叉验证:2 个独立主体(arXiv、Hugging Face Papers)报道了这件事,同一家公司的多个渠道只算一次。质量分在单条最高分基础上加了 10 分。