Graduate-Level Google-Proof Q&A.

448 expert-level questions in biology, physics, and chemistry. Designed to be unsearchable.

Paper ↗Submit a result ↵

§ 01 · Leaderboard

Best published scores.

33 results indexed across 1 metric. Shaded row marks current SOTA; ties broken by submission date.

Primary: accuracy · higher is better

accuracy· primary

33 rows

#	Model	Org	Submitted	Paper / code	accuracy
01	Gemini 3 ProAPI	Google	Apr 2026	google-blog	91.90
02	Claude Opus 4.6API	Anthropic	Apr 2026	anthropic-opus-4-6-announcement	91.30
03	Gemini 3 FlashAPI	Google	Apr 2026	google-blog	90.40
04	Claude Sonnet 4.6API	Anthropic	Apr 2026	anthropic-sonnet-4-6-system-card	89.90
05	GPT-5API	OpenAI	Apr 2026	openai-gpt-5-launch	89
06	Grok 4API	xAI	Apr 2026	xai-grok-4-announcement	88
07	Gemini 2.5 ProAPI	Google	Mar 2026	google-technical-report	84
08	o3API	OpenAI	Mar 2026	openai-simple-evals	82.80
09	Gemini 2.5 Flash	Google	Apr 2026	google-model-card	82.80
10	o4-miniAPI	OpenAI	Mar 2026	openai-simple-evals	77.60
11	Claude Opus 4API	Anthropic	Mar 2026	anthropic-model-card	76.70
12	o1API	OpenAI	Mar 2026	openai-simple-evals	75.70
13	Claude Opus 4.5API	Anthropic	Mar 2026	anthropic-model-card	74.90
14	o3-miniAPI	OpenAI	Mar 2026	openai-simple-evals	74.90
15	o1-previewAPI	OpenAI	Mar 2026	openai-simple-evals	73.30
16	DeepSeek R1OSS	DeepSeek	Mar 2026	arxiv	71.50
17	Qwen3-235B-A22B	Alibaba	Apr 2026	qwen-model-card	71.10
18	Claude Sonnet 4API	Anthropic	Mar 2026	anthropic-model-card	70
19	Llama-4-MaverickOSS	Meta	Mar 2026	meta-blog	69.80
20	GPT-4.5 PreviewAPI	OpenAI	Mar 2026	openai-simple-evals	69.50
21	GPT-4.1 miniAPI	OpenAI	Apr 2026	pricepertoken-leaderboard	66.40
22	GPT-4.1API	OpenAI	Mar 2026	openai-simple-evals	66.30
23	o1-miniAPI	OpenAI	Mar 2026	openai-simple-evals	60
24	Claude 3.5 SonnetAPI	Anthropic	Mar 2026	openai-simple-evals	59.40
25	Grok 2API	xAI	Mar 2026	openai-simple-evals	56
26	Llama 3.1 405BOSS	Meta	Mar 2026	openai-simple-evals	50.70
27	Claude 3 OpusAPI	Anthropic	Mar 2026	openai-simple-evals	50.40
28	GPT-4oAPI	OpenAI	Mar 2026	openai-simple-evals	49.90
29	GPT-4 TurboAPI	OpenAI	Mar 2026	openai-simple-evals	49.30
30	Qwen2.5-72B-InstructOSS	Alibaba	Mar 2026	qwen25-tech-report	49
31	Gemini 1.5 ProAPI	Google	Mar 2026	openai-simple-evals	46.20
32	Llama 3.1 70BOSS	Meta	Mar 2026	openai-simple-evals	41.70
33	GPT-4o mini	OpenAI	Mar 2026	openai-simple-evals	40.20

Fig 2 · Rows sorted by score within each metric. Shaded row marks SOTA. Dates reflect model or paper release where available, otherwise the date Codesota accessed the source.

§ 03 · Progress

3 steps
of state of the art.

Each row below marks a model that broke the previous record on accuracy. Intermediate submissions are kept in the leaderboard above; only SOTA-setting entries are re-listed here.

Higher scores win. Each subsequent entry improved upon the previous best.

SOTA line · accuracy

Mar 3, 2026o3OpenAI82.80
Mar 27, 2026Gemini 2.5 ProGoogle84
Apr 12, 2026Gemini 3 ProGoogle91.90

Fig 3 · SOTA-setting models only. 3 entries span Mar 2026 → Apr 2026.

§ 06 · Contribute

Have a score that beats
this table?

Submit a checkpoint and a reproduction script. We will run it, publish the score, and — if it takes the top — annotate the step on the progress chart with your name.

Submit a result ↵Read submission guide

What a submission needs

01A public checkpoint or API endpoint
02A reproduction script with frozen commit + seed
03Declared evaluation environment (Python, deps)
04One row per metric declared by this dataset
05A contact so we can follow up on discrepancies

Graduate-Level Google-Proof Q&A.

Best published scores.

3 stepsof state of the art.

Neighbouring benchmarks.

Have a score that beatsthis table?

3 steps
of state of the art.

Have a score that beats
this table?