Llega GPT-5.4 de OpenAI y supera a los humanos en tareas profesionales

Puntuación0
Puntuación0

OpenAI GPT 5.4
Créditos: Divulgación/OpenAI

EL AbiertoAI lanzó este jueves (5), GPT-5.4, su nuevo modelo de inteligencia artificial descrito como “los más capaces y eficientes para el trabajo profesional«. La empresa puso el modelo a disposición en ChatGPT, API y Codex simultáneamente, en respuesta a la creciente demanda de soluciones de IA destinadas a tareas corporativas altamente complejas. Además de la versión estándar, OpenAI también lanzó GPT-5.4 Thinking, centrado en el razonamiento, y GPT-5.4 Pro, destinado al máximo rendimiento.

Leer más:

VERSIONES Y DIFERENCIALES

GPT-5.4 está disponible en tres versiones, cada una con un enfoque diferente:

  • GPT-5.4 (predeterminado): disponible en ChatGPT, API y Codex; incorpora capacidades de codificación de GPT-5.3-Codex y mejora el rendimiento en hojas de cálculo, presentaciones y documentos
  • GPT-5.4 Pensamiento: muestra un plan inicial de razonamiento antes de completar la respuesta, lo que permite al usuario ajustar la ruta de la tarea mientras el modelo aún está funcionando; También mejora la búsqueda web en profundidad, especialmente en consultas muy específicas.
  • GPT-5.4 Pro: optimizado para un máximo rendimiento en tareas complejas; disponible en ChatGPT y la API para aquellos que necesitan el mejor resultado posible

USO DE LA COMPUTADORA Y API

En API y Codex, GPT-5.4 se destaca como el primer modelo de propósito general de OpenAI con capacidad de escritorio nativa. Esto significa que los agentes de IA pueden operar sistemas operativos, navegar por navegadores y realizar tareas en aplicaciones como Gmail y Excel sin necesidad de integraciones adicionales.

OpenAI contrata al desarrollador detrás del éxito del agente OpenClaw

Otros aspectos técnicos destacados para los desarrolladores incluyen:

  • Ventana contextual para hasta 1 millón de tokens: la más grande jamás ofrecida por OpenAI en la API
  • Nuevo sistema Búsqueda de herramientasque permite al agente buscar definiciones de herramientas solo cuando sea necesario, reduciendo el consumo de tokens en sistemas con muchas integraciones.
  • Eficiencia de token significativamente mayor que GPT-5.2, lo que resulta en respuestas más rápidas y costos más bajos.

OpenAI también avanza en otros frentes del hardware, demostrando que la estrategia de la empresa va más allá de los modelos lingüísticos.

PUNTOS DE REFERENCIA Y RENDIMIENTO

Los resultados del benchmark muestran un salto significativo en comparación con los modelos anteriores:

Punto de referencia GPT-5.4 GPT-5.3-Códice GPT-5.2
PIBval (ganadores o empates) 83,0% 70,9% 70,9%
SWE-Bench Pro (público) 57,7% 56,8% 55,6%
OSWorld-Verified 75,0% 74,0% 47,3%
Atlón de herramientas 54,6% 51,9% 46,3%
NavegarComp 82,7% 77,3% 65,8%

En OSWorld-Verified, que mide el uso de la computadora mediante capturas de pantalla, GPT-5.4 logró un 75 % de éxito, superando incluso el rendimiento humano, fijado en un 72,4 %. En GDPval, que evalúa agentes en 44 ocupaciones profesionales, el modelo igualó o superó a los profesionales humanos en el 83% de las comparaciones.

PRECISIÓN Y REDUCCIÓN DE ALUCINACIONES

OpenAI afirma que GPT-5.4 es su modelo más real hasta la fecha. Comparado con GPT-5.2:

  • Las declaraciones individuales son 33% menos probable que contiene errores
  • Las respuestas completas tienen 18% menos de posibilidades incluir cualquier tipo de error

Este avance es el resultado del esfuerzo continuo de la compañía para reducir las alucinaciones, uno de los problemas más críticos con los modelos de lenguaje grandes. OpenAI también introdujo una nueva evaluación de seguridad para probar la cadena de razonamiento del modelo, concluyendo que es menos probable que GPT-5.4 Thinking oculte o distorsione su proceso de pensamiento.

REVISIONES DEL MERCADO

Profesionales de las áreas jurídica y financiera ya probaron el modelo y reportaron resultados positivos.

«GPT-5.4 es el mejor modelo que hemos probado jamás. Lidera nuestro punto de referencia APEX-Agents, que mide el rendimiento del trabajo de servicios profesionales. Destaca en la creación de resultados a largo plazo, como presentaciones, modelos financieros y análisis legales, y ofrece un alto rendimiento a mayor velocidad y menor costo que los modelos competitivos de alta gama». dijo Brendan Foody, director ejecutivo de Mercor.

Google anuncia Gemini 3.1 Pro para resolver problemas complejos

Niko Grupen, jefe de investigación aplicada de Harvey, también destacó los resultados en el área jurídica: «GPT-5.4 establece un nuevo estándar para el trabajo legal con documentos largos. En nuestro punto de referencia BigLaw Bench, obtuvo una puntuación del 91 %. Actualmente es mejor a la hora de estructurar análisis transaccionales complejos, mantener la precisión en contratos largos y ofrecer el nivel de detalle que exigen los profesionales del derecho».

DISPONIBILIDAD

  • ChatGPT: implementación gradual a los planes Plus, Team, Pro y Enterprise
  • API: Ahora disponible para desarrolladores, con soporte para 1 millón de tokens de contexto y búsqueda de herramientas
  • Códice: disponible simultáneamente con el lanzamiento
  • Empresa: Los clientes también tienen acceso al nuevo complemento ChatGPT para Excel, lanzado en la misma fecha.

Fuente: OpenAI

Únase al grupo de oferta Mundo Conectado

Únase al grupo de oferta Mundo Conectado

Consulta las principales ofertas en Smartphones, TVs y otros aparatos electrónicos que encontramos online. Al unirte a nuestro grupo, recibes promociones diarias y tienes acceso temprano a cupones de descuento.

Únete al grupo y aprovecha las promociones.

Estaremos encantados de escuchar lo que piensas

Deje una respuesta

Lucas Laruffa
Logo