Codesota · Benchmark · D4RL HalfCheetah-Medium-v2Home/Leaderboards/Robotics, Control & RL/Offline RL/D4RL HalfCheetah-Medium-v2
Unknown

D4RL HalfCheetah-Medium-v2.

Canonical offline RL benchmark environment from D4RL. The halfcheetah-medium-v2 dataset contains 1M transitions collected from a medium-level SAC policy. Scores are reported as normalized return where 0 = random policy and 100 = expert SAC policy.

Paper Leaderboard
§ 01 · Leaderboard

Results by metric.

Only 3 models on this benchmark
Help build the community leaderboard — submit your model results.
Found a wrong score or missing run?
Use row edits to send a sourced correction into moderation.
Add / edit result Report issue

Normalized Return

Normalized Return is the reported evaluation metric for D4RL HalfCheetah-Medium-v2. Codesota tracks published model scores on this metric so readers can compare state-of-the-art results across sources and model families.

Higher is better

Trust tiers for Normalized Returnverifiedpapervendorcommunityunverified

Muted rows were not state of the art when published — an earlier or same-year result already scored better.

RankModelTrustScoreYearLinksFix
01Diffusion-QL
halfcheetah-medium-v2, Diffusion-QL paper (Wang et al. ICLR 2023). seed — verify
paper51.12026Source ↗Looks wrong?
02IQL (Implicit Q-Learning)
halfcheetah-medium-v2, IQL paper Table 1 (Kostrikov et al. ICLR 2022).
paper47.42026Source ↗Looks wrong?
03CQL (Conservative Q-Learning)
halfcheetah-medium-v2, reported in IQL paper (Kostrikov 2022) Table 1.
paper442026Source ↗Looks wrong?
§ 04 · Submit a result

Add to the leaderboard.

← Back to Offline RL