Ir al contenido

Gemini (bot conversacional)

✏️ Editar🕓 Historial🔗 Enlaces
Gemini
Nombre anteriorGoogle Bard
DesarrolladorGoogle, con participación de Google DeepMind
Lanzamiento inicial21 de marzo de 2023
Modelo subyacenteFamilia Gemini Pro
LicenciaSoftware propietario
Idiomas46, incluido el español
Sitio webgemini.google.com

Gemini, conocido antes como Google Bard, es un bot conversacional de inteligencia artificial multimodal y generativa desarrollado por Google. Funciona sobre la familia de modelos de lenguaje denominada Gemini Pro y fue concebido como respuesta directa a la irrupción de ChatGPT, el bot conversacional de OpenAI.[1] El servicio se lanzó de forma limitada el 21 de marzo de 2023 y pasó a llamarse oficialmente Gemini el 8 de febrero de 2024.

A diferencia de un buscador tradicional, Gemini está diseñado para mantener conversaciones, generar texto, redactar contenido, resumir documentos, escribir y explicar código, así como producir imágenes en distintas versiones del producto. Está disponible en varios idiomas, entre ellos el español, y forma parte de una estrategia más amplia de Google para integrar modelos de lenguaje en sus servicios de productividad, búsqueda y dispositivos.

1. Resumen[editar]

Gemini es el asistente conversacional orientado al gran público de Google. Heredero de la tecnología experimental de LaMDA, nació en un contexto de fuerte presión competitiva después de que ChatGPT se convirtiera en un fenómeno viral a finales de 2022. La empresa reorganizó equipos y prioridades para acelerar el desarrollo de un producto capaz de competir con OpenAI y con Microsoft, que había empezado a integrar capacidades de inteligencia artificial generativa en Bing y en Microsoft Copilot.

El producto se dio a conocer con el nombre de Google Bard, pero en 2024 la compañía unificó la marca bajo la denominación del modelo de lenguaje que le da soporte: Gemini. Con el cambio no solo se modificó el nombre comercial, sino que se ampliaron sus capacidades, se lanzaron aplicaciones móviles y se habilitó el acceso a modelos de mayor rendimiento. El servicio ha sido objeto de atención mediática tanto por sus avances como por sus errores públicos, entre ellos respuestas inexactas durante la fase inicial y una controversia vinculada a la generación de imágenes históricamente incorrectas.

2. Antecedentes[editar]

En noviembre de 2022, OpenAI lanzó ChatGPT, un bot conversacional basado en modelos de la familia GPT-3. La herramienta atrajo rápidamente la atención mundial y se convirtió en una sensación viral de internet.[2] La popularidad de ChatGPT encendió las alarmas en Google, cuyo negocio de búsqueda podía verse amenazado si los usuarios adoptaban formas conversacionales de obtener información.

Según reportes de prensa, los directivos de Google emitieron una alerta de “código rojo” y reasignaron equipos para reforzar los esfuerzos en inteligencia artificial.[3] Larry Page y Sergey Brin, cofundadores de Google que habían dejado sus funciones ejecutivas en Alphabet en 2019, fueron convocados a reuniones de emergencia para discutir la respuesta de la compañía. En una reunión general, algunos empleados preguntaron si LaMDA, el modelo de lenguaje que Google había presentado anteriormente, representaba una oportunidad perdida frente a ChatGPT. Según los relatos periodísticos, el director ejecutivo Sundar Pichai y el responsable de inteligencia artificial Jeff Dean señalaron que, aunque Google tenía capacidades similares, moverse demasiado rápido podía implicar un riesgo de reputación significativo para una empresa mucho más grande que OpenAI.

Poco después, en enero de 2023, Demis Hassabis, director general de Google DeepMind, anunció planes para crear un competidor de ChatGPT.[4] Dentro de Google, algunos empleados comenzaron a probar internamente un prototipo conocido como “Apprentice Bard”. La presión se intensificó cuando Microsoft presentó la nueva versión de Bing con funciones conversacionales y anunció una inversión multimillonaria en OpenAI, dejando en evidencia que la competencia no se limitaba a productos aislados, sino a la manera en que los usuarios accederían a la información.

3. Historia[editar]

3.1. Lanzamiento inicial como Bard[editar]

Google Bard se lanzó de forma limitada el 21 de marzo de 2023 en Estados Unidos y el Reino Unido. La acogida inicial fue tibia. En una de las primeras demostraciones públicas, el bot dio información incorrecta al ser consultado sobre el Telescopio Espacial James Webb, lo que generó críticas y provocó comparaciones desfavorables con ChatGPT.[5] El episodio se convirtió en un ejemplo temprano de los riesgos vinculados a las alucinaciones de los modelos de lenguaje.

El 10 de mayo de 2023, durante el evento Google I/O celebrado en Mountain View, California, Bard fue presentado oficialmente al público. En esa instancia Google anunció la eliminación gradual de la lista de espera y la expansión del acceso. La implementación en Europa se demoró hasta julio de 2023, en parte por el temor de la compañía a incumplir el Reglamento General de Protección de Datos de la Unión Europea (RGPD). La decisión subrayó las diferencias regulatorias entre los mercados y la cautela de Google en materia de privacidad.

Durante los primeros meses, Bard no tuvo paridad de funciones con ChatGPT en todos los idiomas. Las versiones iniciales estaban optimizadas sobre todo para el inglés y el acceso se fue ampliando progresivamente. Google presentó además extensiones que permitían al bot conectarse con aplicaciones como Gmail y Google Docs, aunque las opiniones sobre su utilidad fueron dispares.

3.2. Integración de Gemini Pro y expansión global[editar]

En diciembre de 2023, Google incorporó el modelo Gemini Pro a Bard. En una primera etapa, la integración se limitó al idioma inglés y aportó mejoras en comprensión, razonamiento, síntesis y programación. El cambio representó un salto cualitativo frente a las versiones basadas en modelos anteriores y marcó el inicio de la convergencia entre el asistente conversacional y la nueva familia de modelos.

El 1 de febrero de 2024, Google anunció que Gemini Pro llegaba a Bard en más de 40 idiomas y en más de 230 países, incluidos los mercados de habla hispana. La expansión coincidió con un esfuerzo por posicionar la herramienta como una opción viable para usuarios no angloparlantes y por reducir la percepción de que Google iba a la zaga de sus competidores.

Una semana después, el 8 de febrero de 2024, Google anunció el cambio de nombre de Bard a Gemini. La nueva denominación buscaba alinear el producto con la marca del modelo subyacente y comunicar que el asistente no era un experimento aislado, sino una plataforma en crecimiento. En el mismo anuncio se presentó la aplicación móvil de Gemini y se destacó la disponibilidad del modelo Ultra 1.0 para los planes de pago.

3.3. Gemini 1.5 y evolución posterior[editar]

El 15 de febrero de 2024, Google anunció la versión 1.5 de Gemini. Según la compañía, Gemini 1.5 Pro superaba la velocidad de la versión 1.0 Pro en el 87 %[sin verificar] de las pruebas de referencia empleadas para evaluar grandes modelos de lenguaje. El anuncio se enmarcó en una carrera abierta por reducir la latencia, ampliar la ventana de contexto y mejorar el desempeño en tareas complejas.

A lo largo de 2024, Google continuó ampliando la integración de Gemini en sus aplicaciones. El bot dejó de ser únicamente una página web independiente y pasó a estar presente, con funciones variables, en servicios de productividad, en el asistente de Android y en la experiencia de búsqueda de Google. La empresa también introdujo planes de suscripción con acceso a modelos más avanzados, como Gemini Advanced, y comenzó a experimentar con herramientas de análisis, generación de imágenes y ejecución de código.

4. Características[editar]

Gemini es un bot conversacional multimodal y generativo. Eso significa que puede procesar y producir distintos tipos de contenido: texto, imágenes y, en versiones más avanzadas, otros formatos. Su interfaz principal es una ventana de conversación en la que el usuario escribe una instrucción o pregunta y el sistema devuelve una respuesta generada.

Entre las funciones destacadas se encuentran la redacción de textos de distinto género, la síntesis de documentos, la traducción, la explicación de conceptos, la generación de ideas y la escritura o depuración de código. Las extensiones permiten que el bot consulte o interactúe con otros servicios de Google, como Gmail, Google Docs o Google Drive. Google ha integrado además capacidades de búsqueda para que las respuestas puedan incluir información reciente.

El producto se ofrece de forma gratuita con ciertas limitaciones y dispone de un plan de suscripción denominado Gemini Advanced. Las funciones concretas varían según la región, el idioma y el tipo de cuenta, lo que ha generado diferencias en la experiencia de los usuarios fuera de Estados Unidos. La generación de imágenes estuvo disponible durante un tiempo, fue suspendida temporalmente tras una controversia en febrero de 2024 y posteriormente se restableció con restricciones.

5. Recepción[editar]

5.1. Respuesta crítica inicial[editar]

Las primeras evaluaciones de Bard fueron mayoritariamente mixtas. James Vincent, de The Verge, encontró que el bot era más rápido que ChatGPT y que Microsoft Copilot, pero señaló que la ausencia de notas al pie, al estilo de Bing, era “a la vez una bendición y una condena”. Su colega David Pierce criticó las respuestas poco interesantes y a veces inexactas, y observó que la interfaz se parecía a la de un motor de búsqueda, a pesar de que Google insistía en que no lo era.

Cade Metz, de The New York Times, describió a Bard como “más cauteloso” que ChatGPT, mientras que Shirin Ghaffary, de Vox, lo calificó de “seco y poco polémico”. Geoffrey A. Fowler, de The Washington Post, consideró que el bot era una mezcla: actuaba con prudencia, pero podía reflejar sesgos presentes en internet. Sabrina Ortiz, de ZDNet, opinó que ChatGPT y Bing Chat eran más capaces en general, y Lauren Goode, de Wired, describió su conversación con Bard como la más extraña entre los tres bots probados.

Después de la introducción de extensiones, Kevin Roose, de The New York Times, consideró que la actualización era poco impresionante y “un poco desordenada”. Lakshmi Varanasi, de Business Insider, notó que Bard tendía a caer en la adulación antes que en la precisión. En una entrevista del programa 60 Minutes, el corresponsal Scott Pelley encontró a Gemini “inquietante”. The New York Times realizó una prueba comparativa entre ChatGPT y Gemini en tareas propias de un asistente humano y concluyó que el desempeño de ChatGPT era ampliamente superior. Aun así, la herramienta NewsGuard encontró que Gemini era más hábil que ChatGPT para desmentir teorías de conspiración conocidas.

5.2. Controversia sobre la generación de imágenes[editar]

El incidente más visible en la historia temprana de Gemini ocurrió en febrero de 2024. Usuarios de redes sociales informaron que el bot generaba imágenes de personas racializadas y de mujeres en contextos históricos que no correspondían, como vikingos y soldados nazis. Además, el sistema se negaba a producir imágenes de personas blancas, lo que fue interpretado por sectores conservadores y libertarios como una prueba del activismo social de Google.[6]

Las imágenes se viralizaron y provocaron burlas generalizadas. Elon Musk, cuya empresa xAI opera el chatbot Grok, criticó a Google y describió su conjunto de productos como sesgado y racista. También se multiplicaron los ataques personales contra empleados, lo que llevó a uno de los responsables del producto a apartarse de X y LinkedIn. El tabloide New York Post dedicó una portada al incidente.

Google reaccionó pausando la capacidad de Gemini para generar imágenes de personas. El ejecutivo a cargo de búsqueda publicó una explicación en la que admitió que el sistema había “compensado en exceso” en su esfuerzo por buscar diversidad y calificó las imágenes de “vergonzosas e incorrectas”. El director ejecutivo Sundar Pichai envió un memorando interno en el que consideró el fallo como ofensivo e inaceptable y prometió cambios estructurales y técnicos.[7] Días después, varios empleados del equipo de confianza y seguridad de Google fueron despedidos.

Demis Hassabis, director general de Google DeepMind, declaró que la generación de imágenes de personas se restauraría en un plazo de aproximadamente dos semanas. Sin embargo, la polémica ya había provocado una caída de las acciones de Alphabet de alrededor del 4,4 % y generado llamados públicos a la renuncia de Pichai. Algunos analistas atribuyeron el problema al lanzamiento apresurado del producto, mientras que otros lo vincularon a debilidades más profundas en los datos y algoritmos de entrenamiento.

5.3. Otros incidentes[editar]

Después de la controversia por las imágenes, algunos usuarios acusaron a las respuestas de texto de Gemini de inclinarse hacia la izquierda. En un tuit viral, el bot respondió que era “difícil decir de forma definitiva” si Elon Musk o Adolf Hitler habían tenido un impacto más negativo en la sociedad. La respuesta se difundió con rapidez y avivó las críticas sobre los sesgos del sistema.

En India, el viceministro de Electrónica y Tecnología de la Información acusó a Google de violar las normas de tecnología del país después de que Gemini se negara a resumir un artículo del sitio conservador OpIndia. Posteriormente, el bot generó otra polémica al afirmar que el primer ministro de la India había sido acusado de aplicar políticas fascistas, mientras evitaba pronunciarse de forma similar sobre otros líderes.

En Francia, el regulador de competencia francés impuso a Google una multa de 250 millones de euros[sin verificar] en el marco de la directiva europea sobre derechos de autor. Parte de la sanción se relacionó con la falta de información clara a los editores de noticias sobre el uso de su contenido para entrenar modelos como Gemini.

6. Disponibilidad en español y América Latina[editar]

Gemini está disponible en español desde la fase de expansión global. El idioma español fue uno de los idiomas incluidos en la ampliación de febrero de 2024, cuando Gemini Pro llegó al bot en más de 40 idiomas.[8] La interfaz, las respuestas y la documentación oficial de Google emplean variantes neutras del español, con adaptaciones específicas para el público latinoamericano en algunos materiales promocionales.

La disponibilidad real del servicio en América Latina no fue uniforme en los primeros meses. Algunas funciones, como la generación de imágenes o el acceso a modelos avanzados, se desplegaron de manera gradual según el país y el tipo de cuenta. Google no ha hecho públicos, en todos los casos, calendarios de lanzamiento por mercado, por lo que los usuarios de la región experimentaron diferencias temporales en el acceso a determinadas características.

El bot compite en la región con ChatGPT, Microsoft Copilot y otros asistentes basados en inteligencia artificial. Los debates en redes sociales y medios tecnológicos hispanohablantes han girado en torno a la calidad de las respuestas en español, la pertinencia cultural de los ejemplos y la capacidad del sistema para comprender modismos y referencias locales. La controversia global sobre sesgo también se replicó en español, aunque con menor intensidad.

7. Véase también[editar]

  • Tay (bot)
  • Microsoft Copilot
  • ChatGPT
  • Gemini (modelo de lenguaje)

  1. ChatGPT fue lanzado por OpenAI en noviembre de 2022 y se convirtió en un fenómeno viral, lo que obligó a Google a replantear su estrategia de productos conversacionales. ↩︎

  2. La DW calificó a ChatGPT como “el bot viral y futuro de la IA que podría cambiarlo todo”. ↩︎

  3. La alerta de “código rojo” fue reportada por Business Insider y otros medios tecnológicos en diciembre de 2022. ↩︎

  4. DeepMind preparaba entonces un chatbot que la prensa identificó como Sparrow, aunque el producto final terminó confluyendo en la familia Gemini. ↩︎

  5. El error sobre el Telescopio Espacial James Webb se produjo en una demostración inicial y afectó la percepción del producto en sus primeras semanas. ↩︎

  6. El término “wokeness” fue ampliamente utilizado en publicaciones conservadoras y libertarias para describir la supuesta agenda ideológica del producto. ↩︎

  7. El memorando de Pichai fue publicado por Bloomberg, NPR y Semafor. ↩︎

  8. La cifra exacta de idiomas puede variar según la fuente y la fecha de consulta; la ficha técnica del proyecto menciona 46 idiomas. ↩︎