Ir al contenido

GPT-4

✏️ Editar🕓 Historial🔗 Enlaces
GPT-4 · artículos relacionados[ Desplegar · Plegar ]
PaísesEstados Unidos · México · Colombia · Uruguay · Brasil
MúsicaBad Bunny · Peso Pluma
CiudadesMedellín · Quito
GPT-4
TipoModelo de lenguaje grande multimodal
DesarrolladorOpenAI
Fecha de lanzamiento14 de marzo de 2023
PredecesorGPT-3 · GPT-3.5
Sitio webopenai.com/gpt-4

1. Resumen[editar]

GPT-4 (Generative Pre-trained Transformer 4) es un modelo de lenguaje grande (LLM) multimodal de última generación desarrollado por OpenAI. Fue lanzado oficialmente el 14 de marzo de 2023, y constituye el sucesor directo de la serie GPT-3, que impulsó la primera versión ampliamente popular de ChatGPT. A diferencia de sus predecesores, GPT-4 fue diseñado desde el inicio para procesar no solo texto sino también imágenes como entrada, permitiéndole describir el contenido visual, analizar gráficos y leer texto incrustado en fotografías. Su salida, sin embargo, permanece en formato texto. El modelo está disponible comercialmente a través de la interfaz de programación de aplicaciones (API) de OpenAI y como el motor central de ChatGPT Plus, el nivel de suscripción del asistente conversacional.

El desarrollo de GPT-4 se enmarcó en un esfuerzo de OpenAI por mejorar la precisión factual, la capacidad de razonamiento y la seguridad de los grandes modelos de lenguaje. Según la documentación técnica preliminar, el modelo exhibe un rendimiento a nivel humano en diversas pruebas profesionales y académicas, incluyendo la obtención de una puntuación en el percentil 90 en el Uniform Bar Exam (examen unificado de abogacía de los Estados Unidos). Su entrenamiento, basado en una arquitectura de transformador con datos hasta septiembre de 2021 en su versión inicial, fue optimizado mediante aprendizaje por refuerzo a partir de retroalimentación humana (RLHF) para alinear sus respuestas con las intenciones del usuario y mitigar sesgos y alucinaciones.

2. Desarrollo y arquitectura[editar]

El proceso de desarrollo de GPT-4 difirió del de los modelos anteriores al enfatizar la creación de una infraestructura entrenable estable y predecible. OpenAI construyó internamente un clúster de supercómputo dedicado en Microsoft Azure, optimizado para las cargas de trabajo de inteligencia artificial. La compañía declaró que logró predecir aspectos significativos del rendimiento de GPT-4 utilizando modelos más pequeños, un avance en los métodos de escalado que redujo la necesidad de extensas pruebas empíricas y permitió una asignación más eficiente de recursos computacionales.

La arquitectura técnica se basa en redes neuronales del tipo transformador generativo preentrenado. Si bien OpenAI no publicó el número exacto de parámetros del modelo, eliminando la tradición de transparencia de sus predecesores, diversas fuentes de la industria estiman que GPT-4 es un modelo significativamente más denso, con un tamaño total que podría superar los 1.7 billones de parámetros, distribuidos en una mezcla de expertos (MoE, por sus siglas en inglés) que activa subconjuntos especializados del modelo para diferentes tareas. Esta arquitectura mejora la eficiencia computacional durante la inferencia y el entrenamiento. La multimodalidad nativa, una de las características definitorias, se integró desde la fase de preentrenamiento, a diferencia de modelos anteriores que requerían adaptadores visuales añadidos posteriormente.

3. Capacidades y características principales[editar]

3.1. Procesamiento multimodal[editar]

La capacidad de aceptar imágenes como entrada (llamada “visión”) permite a GPT-4 interpretar el contenido de una fotografía, describir una escena, identificar objetos, leer texto manuscrito o impreso dentro de una imagen, y analizar gráficos estadísticos o diagramas. Por ejemplo, el modelo puede recibir la foto del interior de un refrigerador y sugerir recetas con los ingredientes visibles, o interpretar un gráfico de barras para generar un resumen analítico. Esta característica no estuvo inmediatamente disponible para todos los usuarios en la interfaz de ChatGPT al momento del lanzamiento, y su despliegue completo se ha dado de forma gradual, pasando por extensos filtros de seguridad relacionados con el reconocimiento facial y otros problemas de privacidad.

3.2. Razonamiento y conocimiento avanzados[editar]

OpenAI reportó que GPT-4 supera a su predecesor, GPT-3.5, en una amplia gama de exámenes diseñados para humanos. Los resultados más destacados incluyen su desempeño en el examen SAT de razonamiento, donde obtuvo una puntuación de 1520 de 1600, ubicándolo en el percentil de élite para aspirantes universitarios. En el ámbito de las ciencias, el modelo se situó en el percentil 99 en la Olimpiada Internacional de Biología. La ventana de contexto, es decir, la cantidad de texto que el modelo puede procesar en una sola solicitud, se expandió drásticamente respecto a GPT-3.5. Se ofrecieron variantes con hasta 32 000 tokens de contexto desde el lanzamiento para la API, y posteriormente se habilitó una versión con 128 000 tokens, lo que equivale aproximadamente a 300 páginas de un libro estándar, permitiendo el análisis de documentos completos.

3.3. Mayor precisión factual y seguridad[editar]

Un objetivo central del desarrollo de GPT-4 fue reducir las llamadas “alucinaciones”, en las que el modelo inventa datos con aparente convicción. Mediante una iteración intensiva de RLHF, donde evaluadores humanos calificaban las respuestas del modelo según su veracidad, utilidad y alineación, GPT-4 marcó una mejora cuantificable en la precisión factual. Las métricas internas de OpenAI indicaron que GPT-4 es un 40% más preciso que GPT-3.5 en escenarios de evasión de hechos. Asimismo, el modelo mostró una resistencia significativamente mayor a generar contenido prohibido o tóxico. La probabilidad de responder a solicitudes de contenido sensible se redujo drásticamente en comparación con modelos anteriores, gracias a un enfoque de seguridad aplicado tanto en el preentrenamiento como en el ajuste fino de las reglas de comportamiento.

4. Acceso y disponibilidad[editar]

El lanzamiento de GPT-4 el 14 de marzo de 2023 se realizó de manera simultánea en dos canales principales. El primero fue a través de la API de OpenAI, destinada a desarrolladores y empresas que integran el modelo en sus propias aplicaciones, servicios o productos. El acceso a la API de GPT-4 estuvo inicialmente limitado a una lista de espera, que se fue disolviendo a lo largo del año hasta su apertura general. El segundo canal fue ChatGPT Plus, el servicio de suscripción premium de OpenAI, que por un costo mensual de 20 dólares estadounidenses[sin verificar] ofrecía a los suscriptores la opción de seleccionar el modelo GPT-4 como motor para sus conversaciones. Inicialmente, se impuso un límite estricto de mensajes, restricción que se ha ido relajando progresivamente con las optimizaciones del modelo y la infraestructura de OpenAI.

Además de su presencia oficial, GPT-4 se convirtió en un habilitador para numerosas aplicaciones de terceros, desde asistentes legales y médicos hasta herramientas de programación como GitHub Copilot, que a través de una alianza con Microsoft integra el modelo bajo la denominación de Copilot Chat. La multinacional Microsoft confirmó que su renovado motor de búsqueda Bing Chat, renombrado posteriormente como Microsoft Copilot, se ejecutaba sobre una versión personalizada de GPT-4 desde sus primeras fases de prueba.

5. Recepción, impacto y controversias[editar]

La recepción del lanzamiento de GPT-4 por parte de la comunidad técnica y la prensa generalista fue predominantemente positiva, destacando su salto cualitativo en capacidad de razonamiento y su habilidad para resolver problemas complejos que dejaban perplejo a su predecesor. Sin embargo, la ausencia de un artículo técnico detallado que explicara la arquitectura del modelo, el tamaño del conjunto de datos o los parámetros exactos de entrenamiento generó una ola de críticas dentro de la comunidad de investigación en inteligencia artificial. Los críticos argumentaron que este secretismo, motivado en palabras de OpenAI por “razones competitivas y de seguridad”, socavaba el espíritu científico de transparencia y dificultaba la supervisión externa independiente sobre un sistema con un impacto social potencialmente masivo. OpenAI defendió la decisión argumentando que la divulgación de la escala total del modelo podría acelerar carreras armamentísticas en IA.

En cuanto a riesgos y fallos, se documentaron instancias en las que GPT-4 sucumbía a la “ingeniería de prompts”, manipulando al sistema para eludir sus barreras de seguridad a través de juegos de rol o simulación de hipótesis. Un caso emblemático fue la capacidad de algunos usuarios para convencer al modelo de que actuara como un “abuelo” que leía contraseñas robadas para conciliar el sueño, generando así contenido prohibido. Asimismo, la modalidad de visión suscitó preocupaciones sobre la privacidad, como la capacidad de identificar individuos en fotografías, lo que llevó a OpenAI a restringir inicialmente el análisis facial explícito.

6. Presencia en el mundo hispanohablante[editar]

La llegada de GPT-4 tuvo un eco inmediato en las comunidades tecnológicas y de negocios de habla hispana. La calidad del español generado por GPT-4, en sus múltiples variantes dialectales, marcó una diferencia sustancial con la generación anterior, mostrando una fluidez casi nativa y un manejo correcto de modismos regionales, aunque ocasionalmente se detectaron algunos calcos del inglés en traducciones literales.

La adopción empresarial en México, Colombia y Uruguay se ha manifestado en sectores como atención al cliente, donde grandes bancos y empresas de telecomunicaciones exploran el uso de GPT-4 para chatbots avanzados que gestionan consultas en español local. En el ámbito de la educación, varias universidades de América Latina han comenzado a debatir y a establecer normas sobre el uso ético de GPT-4 por parte de los estudiantes, replicando la preocupación global sobre el plagio y la erosión del pensamiento crítico. En el mundo del entretenimiento, creadores de contenido en español han producido tutoriales virales sobre cómo usar ChatGPT con GPT-4 para escribir guiones de YouTube o letras de reguetón, a menudo citando artistas como Bad Bunny o Peso Pluma como ejemplos para simular estilos líricos.

OpenAI no tiene sede en América Latina, pero la interfaz de ChatGPT, con el modelo GPT-4 integrado, está disponible en toda la región y es ampliamente utilizada, a menudo sin necesidad de una tarjeta de crédito internacional para la suscripción a ChatGPT Plus, lo que ha favorecido su penetración masiva. La empresa ha ido añadiendo de forma gradual soporte para más países de la región para el acceso a la API, permitiendo a startups tecnológicas de hubs como Medellín y Quito construir aplicaciones nativas sobre la espina dorsal del modelo.

7. Legado y evolución tecnológica[editar]

GPT-4 se consolidó rápidamente como un punto de inflexión en la percepción pública de la inteligencia artificial. Su lanzamiento aceleró la carrera entre gigantes tecnológicos, con Google lanzando su familia de modelos PaLM 2 y Gemini en un intento por cerrar la brecha, y Meta abriendo gradualmente sus modelos LLaMA. La existencia de GPT-4 también galvanizó el debate regulatorio global, influyendo directamente en la redacción final del Acta de Inteligencia Artificial de la Unión Europea y en las discusiones del Senado de los Estados Unidos sobre licencias para modelos fundacionales de alto poder computacional, un umbral que GPT-4 cruza con creces.

En el ecosistema de código abierto, la opacidad de GPT-4 impulsó un movimiento de reacción a favor del acceso total a los datos de entrenamiento y a las técnicas de ajuste. Aunque ningún modelo abierto ha logrado aún igualarlo en todas las métricas, el modelo se convirtió en el estándar de referencia contra el que se mide el progreso de la IA generativa. La capacidad de GPT-4 para razonar a través de múltiples pasos y su integración con herramientas de análisis de terceros, como intérpretes de código Python o complementos de viaje y datos en tiempo real, sentó las bases para una nueva filosofía de agentes autónomos, donde el modelo no solo chatea, sino que actúa, un paradigma que muchos ven como el siguiente gran salto tras el chatbot.