#benchmark
共 3 篇相关内容 · 安全漏洞、AI动态、技术文章
技术文章 2
Multi-LCB:大模型写代码真的只会Python吗?跨12种编程语言的全面测试揭示了惊人真相
LiveCodeBench是当前最流行的代码生成基准测试之一,但它只考察Python。Multi-LCB将其扩展到12种编程语言,对24个大模型进行了全面评估。结果发现:多数模型存在严重的Python过拟合问题,在其他语言上的表现大幅下滑;不同语言之间的性能差异远超预期;甚至有证据表明某些语言可能受到了数据污染的影响。这项研究为代码大模型的真实能力提供了更全面的衡量标准。
Multi-LCB:把代码能力评测从Python扩展到12种编程语言,大模型的「偏科」问题暴露无遗
Multi-LCB将LiveCodeBench从Python扩展到12种编程语言,评估24个大语言模型后发现三个关键现象:Python过拟合(模型在Python上表现远超其他语言)、语言特定的数据污染、以及多语言性能的巨大落差。该基准测试被ICLR 2026接收,为评估模型真正的跨语言编程能力提供了严谨工具。
情报动态 1
AI 🟢
Qwen 3.7 Max 基准测试超越Claude Opus 4.6
Terminal-Bench 2.0、SWE-Bench Pro、MCP-Atlas均超Claude Opus 4.6,中国模型首次在多项基准领先