Performance Intelligence

    AI Model Benchmarks

    Comprehensive performance comparison across major AI labs · Data sourced from official model cards and benchmark publications

    Last updated: February 19, 2026 · Click column headers to sort

    Lab

    Category

    28 models|14 benchmarks|Sorted by: Model Name
    Model
    ReasoningGPQA Diamond
    KnowledgeMMLU
    KnowledgeMMMLU
    CodingHumanEval
    CodingSWE-bench Ve…
    MathAIME 2024
    MathMATH-500
    ReasoningHLE
    ReasoningARC-AGI-2
    CodingLiveCodeBench
    MultimodalMMMU
    Instruction FollowingIFEval
    ReasoningARC-AGI-1
    EQEQ-Bench 3 (…
    Claude 3.7 Sonnet
    Anthropic · 2025-02
    688893.762.38086.5321083.7
    Claude Opus 4.1
    Anthropic · 2025-04
    79.289.59272.894.891.4601407.9
    Claude Opus 4.5
    Anthropic · 2025-10
    8790.880.910097.53237.678.593.1761683.1
    Claude Opus 4.6
    Anthropic · 2026-02
    91.380.897.64075.2851961
    Claude Sonnet 4.5
    Anthropic · 2025-10
    83.489.1828796.219.86475.492.8641501.4
    Claude Sonnet 4.6
    Anthropic · 2026-02
    74.179.179.697.819.158.3
    DeepSeek V3
    DeepSeek · 2024-12
    59.188.582.64290.287.51048.7
    DeepSeek-R1
    DeepSeek · 2025-01
    71.590.849.279.897.365.983.3451185.6
    Gemini 2.5 Flash
    Google · 2025-04
    70.585.149.68391.26887.5421074.2
    Gemini 2.5 Pro
    Google · 2025-03
    8489.263.89295.221.670.475.889.5631347.8
    Gemini 3 Flash
    Google · 2025-12
    82.187.5629093.574.28955
    Gemini 3 Pro
    Google · 2025-11
    91.991.876.21009745.831.179.58191.5801629.5
    Gemini 3.1 Pro
    Google · 2026-02
    94.392.680.644.477.1
    Gemini Deep Think
    Google · 2026-02
    93.848.484.6
    GPT-4.1
    OpenAI · 2025-04
    66.390.291.554.690.288.4521137.7
    GPT-4o
    OpenAI · 2024-05
    53.688.790.238.476.669.186.1211321.9
    GPT-5
    OpenAI · 2025-08
    88.474.994.697.335.21884.292.5721456.9
    GPT-5.1
    OpenAI · 2025-08
    88.19176.310097.817.685.4751727.6
    GPT-5.2
    OpenAI · 2025-12
    92.4918010098.552.986.5821637
    Grok 3
    xAI · 2025-02
    68.288.589.348.586.793341180.6
    Grok 4
    xAI · 2025-07
    87.586.675959725.476.5711131.7
    Grok 4.20
    xAI · 2026-02
    Kimi K2 Thinking
    Moonshot · 2025-07
    84.571.399.19744.983.1681622.5
    Llama 4 Maverick
    Meta · 2025-04
    69.888.485.58673.490833.2
    Llama 4 Scout
    Meta · 2025-04
    57.285.881.279.669.487.6626.8
    o3
    OpenAI · 2025-04
    83.369.198.496.782.991.887.51500
    o4-mini
    OpenAI · 2025-04
    81.468.199.596.379.690.2721210.6
    Qwen 3
    Alibaba · 2025-04
    71.189.588.487.59562.588.21167.9
    Top tier (≥95%)
    Strong (≥85%)
    Mid-range (≥75%)
    Below avg (≥60%)
    No data
    Anthropic
    (6 models)
    OpenAI
    (7 models)
    Google
    (6 models)
    DeepSeek
    (2 models)
    xAI
    (3 models)
    Meta
    (2 models)
    Moonshot
    (1 model)
    Alibaba
    (1 model)

    Data sourced from official model cards, blog posts, arXiv papers, and independent evaluations. Curated by Natural20 and BuseyBench.