论文研究 · 至

ORCA:评估大模型数据科学代码跨库转换能力的基准

ORCA: Evaluating LLMs on Data Science Code Translation

76进行中2 家报道 · 2 条arXiv cs.AIHF Daily Papers

事件解读

AI 综合 2 家报道

推荐理由帮助开发者准确评估大模型的跨库代码互操作能力。

ORCA评测基准发布,填补大模型数据科学代码跨库翻译评测空白

HF Daily Papers刊发关于伊斯兰伦理转化为LLM对齐数据构建方法的论文

发生了什么

针对大模型数据科学代码跨库翻译评测研究不足的问题,研究团队构建了含1600个细粒度任务、200个全项目级任务的ORCA综合评测基准,配套参考译文与功能验证用例且经多阶段质量核验;测试显示前沿模型Claude-Opus-4.6在两类任务上的翻译成功率分别为56.92%、33.67%,其提出的意图增强翻译方法可分别带来4.80%、5.33%的绝对成功率增益。

关键信息

发布方
研究团队(2026年9月28日arXiv cs.AI公开)
产品
ORCA数据科学代码翻译综合评测基准
参数规模/构成
ORCA-MAIN含1600个细粒度任务,ORCA-PROJECT含200个全项目级任务
上线时间
2026年9月28日
基准成绩
Claude-Opus-4.6在两个子任务集翻译成功率分别为56.92%、33.67%
方法增益
意图增强法使两个子任务集成功率分别提升4.80%、5.33%

背景

当前大模型在数据科学代码跨库翻译(需保持功能等价、实现生态互通)领域的专项评测存在明显研究缺口,尚无成熟的统一评测体系。

为什么重要

对行业而言,ORCA填补了数据科学代码翻译方向的评测空白,可精准定位大模型跨生态代码适配的能力短板;对开发者而言,该基准可帮助其选型适配多库迁移需求的大模型工具,意图增强优化思路也可直接落地到日常翻译工具中;对普通用户而言,跨库代码翻译能力的提升能够有效降低多数据科学生态的使用门槛。

后续看点

后续值得关注各前沿大模型在ORCA基准上的迭代表现,及意图增强方法的落地应用进展。

由 AI 综合 2 篇报道生成,有新报道会更新,可能有疏漏,以原文为准。

报道时间线

交叉验证:2 个独立主体(arXiv、Hugging Face Papers)报道了这件事,同一家公司的多个渠道只算一次。质量分在单条最高分基础上加了 10 分。

  1. arXiv cs.AI ↗ORCA:评估大模型数据科学代码跨库转换能力的基准ORCA: Evaluating LLMs on Data Science Code Translation针对数据科学代码跨库翻译的评估缺口,提出专门的LLM能力评估基准ORCA。
  2. HF Daily Papers ↗提出基于伊斯兰伦理框架的LLM对齐数据构建法From Normative Frameworks to Alignment Data: Constructing and Evaluating SFT and Preference Data论文提出将伊斯兰伦理规范转化为LLM对齐SFT与偏好数据的构建方法。
返回 AI 热点