Llega GPT-5.4 de OpenAI y supera a los humanos en tareas profesionales

EL AbiertoAI lanzó este jueves (5), GPT-5.4, su nuevo modelo de inteligencia artificial descrito como “los más capaces y eficientes para el trabajo profesional«. La empresa puso el modelo a disposición en ChatGPT, API y Codex simultáneamente, en respuesta a la creciente demanda de soluciones de IA destinadas a tareas corporativas altamente complejas. Además de la versión estándar, OpenAI también lanzó GPT-5.4 Thinking, centrado en el razonamiento, y GPT-5.4 Pro, destinado al máximo rendimiento.
Leer más:
VERSIONES Y DIFERENCIALES
GPT-5.4 está disponible en tres versiones, cada una con un enfoque diferente:
- GPT-5.4 (predeterminado): disponible en ChatGPT, API y Codex; incorpora capacidades de codificación de GPT-5.3-Codex y mejora el rendimiento en hojas de cálculo, presentaciones y documentos
- GPT-5.4 Pensamiento: muestra un plan inicial de razonamiento antes de completar la respuesta, lo que permite al usuario ajustar la ruta de la tarea mientras el modelo aún está funcionando; También mejora la búsqueda web en profundidad, especialmente en consultas muy específicas.
- GPT-5.4 Pro: optimizado para un máximo rendimiento en tareas complejas; disponible en ChatGPT y la API para aquellos que necesitan el mejor resultado posible
USO DE LA COMPUTADORA Y API
En API y Codex, GPT-5.4 se destaca como el primer modelo de propósito general de OpenAI con capacidad de escritorio nativa. Esto significa que los agentes de IA pueden operar sistemas operativos, navegar por navegadores y realizar tareas en aplicaciones como Gmail y Excel sin necesidad de integraciones adicionales.
OpenAI contrata al desarrollador detrás del éxito del agente OpenClaw
Otros aspectos técnicos destacados para los desarrolladores incluyen:
- Ventana contextual para hasta 1 millón de tokens: la más grande jamás ofrecida por OpenAI en la API
- Nuevo sistema Búsqueda de herramientasque permite al agente buscar definiciones de herramientas solo cuando sea necesario, reduciendo el consumo de tokens en sistemas con muchas integraciones.
- Eficiencia de token significativamente mayor que GPT-5.2, lo que resulta en respuestas más rápidas y costos más bajos.
OpenAI también avanza en otros frentes del hardware, demostrando que la estrategia de la empresa va más allá de los modelos lingüísticos.
PUNTOS DE REFERENCIA Y RENDIMIENTO
Los resultados del benchmark muestran un salto significativo en comparación con los modelos anteriores:
| Punto de referencia | GPT-5.4 | GPT-5.3-Códice | GPT-5.2 |
|---|---|---|---|
| PIBval (ganadores o empates) | 83,0% | 70,9% | 70,9% |
| SWE-Bench Pro (público) | 57,7% | 56,8% | 55,6% |
| OSWorld-Verified | 75,0% | 74,0% | 47,3% |
| Atlón de herramientas | 54,6% | 51,9% | 46,3% |
| NavegarComp | 82,7% | 77,3% | 65,8% |
En OSWorld-Verified, que mide el uso de la computadora mediante capturas de pantalla, GPT-5.4 logró un 75 % de éxito, superando incluso el rendimiento humano, fijado en un 72,4 %. En GDPval, que evalúa agentes en 44 ocupaciones profesionales, el modelo igualó o superó a los profesionales humanos en el 83% de las comparaciones.
PRECISIÓN Y REDUCCIÓN DE ALUCINACIONES
OpenAI afirma que GPT-5.4 es su modelo más real hasta la fecha. Comparado con GPT-5.2:
- Las declaraciones individuales son 33% menos probable que contiene errores
- Las respuestas completas tienen 18% menos de posibilidades incluir cualquier tipo de error
Este avance es el resultado del esfuerzo continuo de la compañía para reducir las alucinaciones, uno de los problemas más críticos con los modelos de lenguaje grandes. OpenAI también introdujo una nueva evaluación de seguridad para probar la cadena de razonamiento del modelo, concluyendo que es menos probable que GPT-5.4 Thinking oculte o distorsione su proceso de pensamiento.
REVISIONES DEL MERCADO
Profesionales de las áreas jurídica y financiera ya probaron el modelo y reportaron resultados positivos.
«GPT-5.4 es el mejor modelo que hemos probado jamás. Lidera nuestro punto de referencia APEX-Agents, que mide el rendimiento del trabajo de servicios profesionales. Destaca en la creación de resultados a largo plazo, como presentaciones, modelos financieros y análisis legales, y ofrece un alto rendimiento a mayor velocidad y menor costo que los modelos competitivos de alta gama». dijo Brendan Foody, director ejecutivo de Mercor.
Google anuncia Gemini 3.1 Pro para resolver problemas complejos
Niko Grupen, jefe de investigación aplicada de Harvey, también destacó los resultados en el área jurídica: «GPT-5.4 establece un nuevo estándar para el trabajo legal con documentos largos. En nuestro punto de referencia BigLaw Bench, obtuvo una puntuación del 91 %. Actualmente es mejor a la hora de estructurar análisis transaccionales complejos, mantener la precisión en contratos largos y ofrecer el nivel de detalle que exigen los profesionales del derecho».
DISPONIBILIDAD
- ChatGPT: implementación gradual a los planes Plus, Team, Pro y Enterprise
- API: Ahora disponible para desarrolladores, con soporte para 1 millón de tokens de contexto y búsqueda de herramientas
- Códice: disponible simultáneamente con el lanzamiento
- Empresa: Los clientes también tienen acceso al nuevo complemento ChatGPT para Excel, lanzado en la misma fecha.
Fuente: OpenAI
Únase al grupo de oferta Mundo Conectado
Consulta las principales ofertas en Smartphones, TVs y otros aparatos electrónicos que encontramos online. Al unirte a nuestro grupo, recibes promociones diarias y tienes acceso temprano a cupones de descuento.
Únete al grupo y aprovecha las promociones.
