Model Library / Benchmarks / SciCode

Coding & Agents

SciCode

Research coding curated by scientists — generating code for scientific problems decomposed into subproblems. Source: official SciCode leaderboard (main-problem resolve rate).

Features measured

Code Reasoning

Use cases unlocked

Code generation Scientific Q&A STEM tutoring

Leaderboard

Higher is better · % resolved
1 OpenAI o3-mini (low) 10.8%
2 OpenAI o3-mini (high) 9.2%
3 OpenAI o1-preview 7.7%
4 DeepSeek-R1 4.6%
5 Claude 3.5 Sonnet 4.6%
6 DeepSeek-V3 3.1%

Benchmark source ↗

← All benchmarks