← Volver a todos los datasets

Tech & IA · Telemetría en vivo

Benchmarks de conocimiento y código de LLMs

Puntuaciones publicadas de MMLU y HumanEval de los principales modelos de lenguaje, según cada proveedor. No re-medidas de forma independiente.

Unidad
score (0–100)
  • GPT-4o88.7
  • Claude 3.5 Sonnet88.7
  • Llama 3.1 405B88.6
  • DeepSeek-V388.5
  • Gemini 1.5 Pro85.9
  • Mistral Large 284
Integrar

Incorpora esta página de datos en cualquier sitio con un iframe.

<iframe src="https://axiostats.com/es/datasets/llm-leaderboard/" title="AxioStats — Benchmarks de conocimiento y código de LLMs" width="100%" height="480" loading="lazy"></iframe>
Endpoint de API

Los mismos datos que esta página, servidos como JSON estático — sin clave.

curl https://axiostats.com/api/datasets/llm-leaderboard.json
https://axiostats.com/api/datasets/llm-leaderboard.json

Resumen ejecutivo

LLM Knowledge & Coding Benchmarks: GPT-4o encabeza la tabla con 88.7 puntos de MMLU, seguido de Claude 3.5 Sonnet (88.7). La horquilla entre el primero y el último (Mistral Large 2, 84) es de 4.7 puntos.

Los resultados son los publicados por cada proveedor en sus informes (no re-medidos). MMLU mide precisión de conocimiento; HumanEval, generación de código. Consulta la fila 'source' de la tabla para la referencia exacta.

Fuente y metadatos
Actualizado
2024-12-01
Metodología
Puntuaciones publicadas por cada proveedor en informes técnicos y anuncios de lanzamiento (GPT-4o, Claude 3.5 Sonnet, Llama 3.1, DeepSeek-V3, Gemini 1.5, Mistral Large 2). MMLU mide la precisión de conocimiento; HumanEval mide la generación de código (pass@1). AxioStats no re-ejecuta los benchmarks.

Datos

ModeloMMLUHumanEvalFuente
GPT-4o88.790.2OpenAI GPT-4o report
Claude 3.5 Sonnet88.792Anthropic announcement
Llama 3.1 405B88.689Meta Llama 3.1 blog
DeepSeek-V388.582.6DeepSeek-V3 report
Gemini 1.5 Pro85.984.1Gemini 1.5 report
Mistral Large 28481.1Mistral announcement