Codesota · Models · GLM-4.7Zhipu AI9 results · 3 benchmarks
Model card

GLM-4.7.

Zhipu AIopen-source
§ 02 · Benchmarks

Every benchmark GLM-4.7 has a recorded score for.

#BenchmarkArea · TaskMetricValueRankDateSource
01GPQA DiamondReasoning · Multi-step Reasoningaccuracy85.7%#18/74source ↗
02HLEReasoning · Multi-step Reasoningaccuracy24.8%#26/74source ↗
03PLCCNatural Language Processing · Polish Cultural Competencygeography88.0%#27/165source ↗
04PLCCNatural Language Processing · Polish Cultural Competencyculture-and-tradition79.0%#39/165source ↗
05PLCCNatural Language Processing · Polish Cultural Competencyhistory85.0%#40/165source ↗
06PLCCNatural Language Processing · Polish Cultural Competencyaverage73.5%#50/165source ↗
07PLCCNatural Language Processing · Polish Cultural Competencyart-and-entertainment64.0%#50/165source ↗
08PLCCNatural Language Processing · Polish Cultural Competencygrammar66.0%#61/165source ↗
09PLCCNatural Language Processing · Polish Cultural Competencyvocabulary59.0%#75/165source ↗
Rank column shows this model’s position vs all other models scored on the same benchmark + metric (competitors after the slash). #1 in red means current SOTA. Sorted by rank, then newest result.
§ 03 · Strengths by area

Where GLM-4.7 actually performs.

Reasoning
2
benchmarks
avg rank #22.0
Natural Language Processing
1
benchmark
avg rank #48.9
§ 04 · Papers

1 paper with results for GLM-4.7.

  1. 2025-08-08· 2 results

    GLM-4.5: Agentic, Reasoning, and Coding (ARC) Foundation Models

§ 05 · Related models

Other Zhipu AI models scored on Codesota.

GLM-5
130B params · 8 results · 1 SOTA
GLM-4.5
6 results
GLM-4.5-Air
5 results
GLM-OCR
3 results
GLM-4.5
2 results
GLM-4.5-Air
2 results
GLM-4.6
1 result
GLM-4.7
1 result
§ 06 · Sources & freshness

Where these numbers come from.

sdadas/PLCC
7
results
pwc-dump
2
results
7 of 9 rows marked verified.