1. 项目背景与核心价值
去年在NeurIPS评审会上,我和几位IOI金牌得主聊到一个有趣的现象:当前大语言模型(LLM)在编程竞赛中的表现评估存在严重的方法论缺陷。大多数benchmark要么使用过于简单的LeetCode题目,要么直接套用ACM/ICPC原题但缺乏对解题过程的深度分析。这促使我们启动了LiveCodeBench Pro项目——一个由真实编程竞赛选手设计和评估的LLM测试框架。
这个项目的独特之处在于三点:首先,所有测试题都来自编程竞赛中的"灰色地带"题目(即那些有40%-60%参赛者能部分解决但极少完美通过的题目);其次,评估者均为获得过IOI/ICPC奖牌的现役选手;最后,我们引入了动态难度调整机制,能根据模型表现实时改变后续题目的难度曲线。在2024年的预实验中,这套方法成功区分开了GPT-4和Claude 3在算法优化层面的细微差异,而这些差异在传统测试中完全无法显现。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 评估体系设计原理
2.1 题目选择策略
我们从Codeforces、AtCoder等平台的12,000道历史题目中筛选出387道符合以下条件的题目:
- 通过率在45%-55%之间
- 至少有两种截然不同的正确解法
- 包含非典型的边界条件
- 有至少三个版本的官方题解
例如2023年ICPC亚洲区域赛的"动态逆序对"问题,标准解法是CDQ分治,但模型可能会尝试用树套树或分块解决。这类题目能有效检验模型的算法迁移能力。
2.2 评委培训方案
所有评委(目前27位来自15个国家的奖牌得主)需要完成:
- 一致性训练:通过50道校准题目确保评分标准统一
- 反偏见工作坊:识别并消除对特定编程语言的偏好
- 解题过程分析框架培训:使用我们开发的6维度评估表(如下)
| 维度 | 评分标准 | 权重 |
|---|---|---|
| 算法适配性 | 解决方案与问题特性的匹配程度 | 25% |
| 代码健壮性 | 边界条件处理的完备性 | 20% |
| 时间复杂度 | 最优解与实现复杂度的平衡 |
