Voy a buscar información actualizada sobre benchmarks y precios de ambos modelos para 2025.
Tengo datos suficientes. Ahora redacto el artículo. Nota importante: Claude 3.5 Sonnet fue retirado en octubre de 2025, algo que debo mencionar como fin de vida.
title: "Claude 3.5 Sonnet vs GPT-4o para programar: cuál escribe mejor código en 2025"
excerpt: "Comparamos Claude 3.5 Sonnet y GPT-4o en HumanEval, SWE-bench, precio API y ventana de contexto para decidir qué IA escribe mejor código en 2025. Veredicto por lenguaje y perfil de desarrollador."
models: "Anthropic Claude 3.5 Sonnet, OpenAI GPT-4o"
Elegir asistente de IA para picar código dejó de ser un debate de fans hace tiempo. Hoy es una decisión con impacto directo en tu factura mensual, en cuántos bugs se cuelan al pull request y en cuánto tiempo pierdes reescribiendo lo que el modelo te devolvió mal. Los dos nombres que se repiten en cualquier equipo de desarrollo serio son Claude 3.5 Sonnet de Anthropic y GPT-4o de OpenAI. Y no, no rinden igual.
Aviso previo importante: Claude 3.5 Sonnet (versión claude-3-5-sonnet-20241022)
fue retirado el 28 de octubre de 2025, y Anthropic recomienda como sustituto claude-sonnet-4-6
. Aun así, sigue siendo el modelo de referencia sobre el que se han medido la mayoría de comparativas de 2024-2025 y el que muchos equipos mantienen en producción vía API o Cursor. Por eso este análisis tiene sentido — pero si empiezas un proyecto nuevo hoy, considéralo antes de firmar un compromiso largo con el endpoint.
El titular de los benchmarks: quién gana en HumanEval y SWE-bench
Los dos benchmarks que importan para código son HumanEval (funciones sueltas de Python) y SWE-bench Verified (issues reales de GitHub con múltiples archivos). Y aquí Claude gana los dos, aunque por márgenes muy distintos.
En HumanEval la diferencia es cosmética:
Claude 3.5 Sonnet alcanza 92,0% de precisión en los tests de funciones Python de HumanEval, superando ligeramente el 90,2% de GPT-4o
. Menos de dos puntos. Nadie debería decidir por ahí.
Donde la brecha se abre — y es la que de verdad predice cómo va a comportarse el modelo con tu repositorio real — es en SWE-bench Verified.
Claude 3.5 Sonnet puntúa 49% en SWE-Bench Verified, superando a GPT-4o por 11 puntos
.
Ese benchmark comprueba si el modelo puede resolver issues reales de GitHub en repositorios Python populares. Es más duro que HumanEval porque el modelo debe entender una base de código grande, identificar los archivos relevantes, escribir un parche y pasar la suite de tests del repositorio
. Traducción: cuando hay que leer código ajeno y no solo escribirlo desde cero, Claude va once puntos por delante. Eso es mucho.
Ventana de contexto y precio: los números que casi todos se saltan
Aquí el reparto es más limpio de lo que parece.
Claude 3.5 Sonnet cuesta 3 $ por millón de tokens de entrada y 15 $ por millón de salida, con ventana de contexto de 200K
. GPT-4o, por su parte,
está a 2,50 $ por millón de tokens de entrada y 10,00 $ por millón de salida, con ventana de 128.000 tokens
. Precios en dólares porque las APIs se facturan así — Anthropic y OpenAI no ofrecen tarifa oficial en euros, aunque la factura se convierte al tipo de cambio del día.
Claude es un 20-50% más caro por token. GPT-4o tiene un 36% menos de ventana de contexto. Si trabajas con codebases grandes o metes documentación entera en el prompt, esos 72.000 tokens extra de Claude son la diferencia entre resumir y no tener que resumir. En repos pequeños, da igual.
Tabla comparativa por lenguaje
Esta es la tabla que la mayoría de comparativas se salta y donde cambia el veredicto según a qué te dediques:
| Lenguaje / tarea | Claude 3.5 Sonnet | GPT-4o | Ganador |
|---|---|---|---|
| Python (scripts y ML) | 92% HumanEval | 90,2% HumanEval | Claude, por poco |
| JavaScript / TypeScript (frontend) | Mejor con React y previsualización Artifacts | Correcto, sin preview integrado | Claude |
| SQL y análisis de datos | Bueno | Muy bueno, más literal | GPT-4o |
| Rust y lenguajes sistema | Menos entrenado, más cauto | Mejor cobertura del ecosistema | GPT-4o |
| Debugging multi-archivo | 49% SWE-bench Verified | 38% SWE-bench Verified | Claude, con diferencia |
Dónde cada uno es objetivamente mejor
Claude 3.5 Sonnet gana en: debugging de codebases reales (los 11 puntos de SWE-bench no aparecen por casualidad) y en frontend con React gracias a Artifacts, que permite previsualizar componentes sin salir del chat.
Los desarrolladores reportan que Claude 3.5 Sonnet produce código más completo que GPT-4o, con menos errores y mejor comprensión del contexto
.
GPT-4o gana en: precio (un 20% más barato en input, 33% en output) y en integración con el ecosistema OpenAI — function calling, Assistants API, plugins, prompt caching a 1,25 $/M. Si ya estás dentro del stack de OpenAI, cambiar de proveedor tiene fricción real.
Fichas técnicas
Anthropic Claude 3.5 Sonnet (claude-3-5-sonnet-20241022)
| HumanEval | 92,0% |
| SWE-bench Verified | 49,0% |
| Ventana de contexto | 200.000 tokens |
| Precio input / output | 3 $ / 15 $ por millón de tokens |
| Multimodal | Texto + visión (imágenes) |
| Estado | Retirado 28/10/2025 — sucesor: Claude Sonnet 4.6 |
OpenAI GPT-4o
| HumanEval | 90,2% |
| SWE-bench Verified | ~38% |
| Ventana de contexto | 128.000 tokens |
| Precio input / output | 2,50 $ / 10 $ por millón de tokens (cacheado 1,25 $) |
| Multimodal | Texto + visión + audio nativo |
| Estado | Activo; GPT-4.1 reemplaza a GPT-4o como modelo de producción recomendado desde enero 2025, más barato (2/8 $) y con contexto de 1M |
Tabla resumen y puntuación
| Criterio | Claude 3.5 Sonnet | GPT-4o |
|---|---|---|
| Código Python (HumanEval) | 9,2 | 9,0 |
| Debugging real (SWE-bench) | 9,0 | 7,5 |
| Frontend / React | 9,0 | 7,5 |
| SQL / datos | 8,0 | 8,5 |
| Precio | 7,0 | 8,5 |
| Contexto disponible | 9,0 | 7,5 |
| Ecosistema / integraciones | 7,5 | 9,0 |
| Continuidad (roadmap) | 6,0 (retirado) | 8,0 |
| Nota media | 8,1 | 8,2 |
La media se queda pegada porque Claude paga caro el estar descatalogado. Sobre capacidad pura de escribir código, sigue siendo el rey de esa generación. Puedes contrastar la evaluación aquí con lo que dijimos en su día del duelo general de asistentes de IA a 20 €/mes, donde el resultado por producto de consumo era distinto al de la API.
Veredicto por perfil
- Para desarrollador backend con codebases grandes: Claude 3.5 Sonnet. Los 200K de contexto y el 49% en SWE-bench no tienen rival en GPT-4o. Eso sí, migra a Sonnet 4.6 ya.
- Para freelance o startup con presupuesto ajustado: GPT-4o. Un 20-30% más barato, calidad Python casi idéntica y prompt caching agresivo. Si tu factura mensual empieza a doler, aquí ahorras real.
- Para creador de contenido técnico y prototipos frontend: Claude 3.5 Sonnet, por Artifacts. Ver el componente React renderizado en la propia conversación cambia el flujo de trabajo.
- Para trabajo de oficina con Copilot corporativo o Microsoft 365: GPT-4o, sin debate. Está integrado nativamente.
- Mejor relación precio-prestaciones en 2025: GPT-4o. Pierde en SWE-bench, pero por lo que ahorras puedes ejecutar más iteraciones. Si tu flujo tolera "generar dos veces y quedarse con la mejor", compensa.
Para elegir la máquina donde correr todo esto — porque un asistente de IA en la nube no te salva de un portátil lento — echa un vistazo al análisis del MacBook Pro M4 Pro frente al Dell XPS 14 para programar.
FAQ
¿Cuál es mejor para programar en Python en 2025, Claude 3.5 Sonnet o GPT-4o?
Claude 3.5 Sonnet, aunque por poco margen en tareas simples. En HumanEval está en 92% frente al 90,2% de GPT-4o, pero la diferencia real aparece en debugging complejo: 49% vs ~38% en SWE-bench Verified.
¿Qué ventana de contexto tiene cada modelo?
Claude 3.5 Sonnet ofrece 200.000 tokens; GPT-4o se queda en 128.000 tokens. Para meter un repo mediano entero en el prompt, Claude tiene una ventaja de casi 72K tokens.
¿Cuánto cuesta cada API por millón de tokens en 2025?
GPT-4o cuesta 2,50 $ input y 10 $ output por millón de tokens; Claude 3.5 Sonnet cuesta 3 $ input y 15 $ output. GPT-4o es aproximadamente un 25-33% más barato. Ambos precios en dólares, sin IVA — la factura se convierte a euros al cambio del día.
¿Sigue disponible Claude 3.5 Sonnet o está descatalogado?
Claude 3.5 Sonnet fue retirado el 28 de octubre de 2025. Anthropic recomienda migrar a Claude Sonnet 4.6 como sucesor. Si estás empezando un proyecto nuevo, arranca ya con el modelo nuevo — la API del antiguo devolverá errores.

3 comentarios
Pingback: GitHub Copilot vs Cursor: qué asistente de IA para programar compensa por 10-20 €/mes – Comparativa de Tecnología
Pingback: Gemini Advanced vs ChatGPT Plus: qué suscripción de IA merece más la pena en España – Comparativa de Tecnología
Pingback: MacBook Air M3 vs MacBook Pro M4: ¿merece la pena el salto para estudiar programación? – Comparativa de Tecnología