Google Gemini: La plataforma de IA generativa que debes conocer

Google está tratando de causar sensación con Gemini, su conjunto insignia de modelos, aplicaciones y servicios de IA generativa.
Entonces, ¿qué es Géminis? ¿Cómo puedes utilizarlo? ¿Y cómo se compara con la competencia?
Para que sea más fácil mantenerse al día con los últimos desarrollos de Gemini, hemos elaborado esta práctica guía, que mantendremos actualizada a medida que se publiquen nuevos modelos, funciones y noticias de Gemini sobre los planes de Google para Gemini.
¿Qué es Géminis?
Géminis es de Google prometido desde hace mucho tiempo, familia de modelos GenAI de próxima generación, desarrollada por los laboratorios de investigación de IA de Google, DeepMind y Google Research. Viene en tres sabores:
- Géminis Ultrael modelo Géminis con más prestaciones.
- Géminis profesionalun modelo Géminis “ligero”.
- Géminis Nanoun modelo “destilado” más pequeño que se ejecuta en dispositivos móviles como el Pixel 8 Pro.
Todos los modelos Gemini fueron entrenados para ser “nativamente multimodales”; en otras palabras, capaces de trabajar y utilizar más que solo palabras. Fueron entrenados previamente y ajustados en una variedad de audio, imágenes y videos, un gran conjunto de bases de código y texto en diferentes idiomas.
Esto distingue a Gemini de modelos como el LaMDA de Google, que se entrenó exclusivamente con datos de texto. LaMDA no puede comprender ni generar nada más que texto (por ejemplo, ensayos, borradores de correo electrónico), pero ese no es el caso de los modelos Gemini.
¿Cuál es la diferencia entre las aplicaciones Gemini y los modelos Gemini?
Créditos de imagen: Google
Google, demostrando una vez más que carece de habilidad para la marca, no dejó claro desde el principio que Gemini está separada y distinta de las aplicaciones Gemini en la web y en dispositivos móviles (anteriormente Bard). Las aplicaciones Gemini son simplemente una interfaz a través de la cual se puede acceder a ciertos modelos Gemini; considérelo como un cliente para GenAI de Google.
Por cierto, las aplicaciones y modelos de Gemini también son totalmente independientes de Imagen 2, el modelo de conversión de texto a imagen de Google que está disponible en algunas de las herramientas y entornos de desarrollo de la empresa.
¿Qué puede hacer Géminis?
Debido a que los modelos Gemini son multimodales, en teoría pueden realizar una variedad de tareas multimodales, desde transcribir voz hasta subtitular imágenes y videos hasta generar obras de arte. Algunas de estas capacidades ya han llegado a la etapa de producto (más sobre esto más adelante), y Google promete todas ellas, y más, en algún momento en un futuro no muy lejano.
Por supuesto, es un poco difícil creerle la palabra a la empresa.
Google no cumplió con creces con el lanzamiento original de Bard. Y más recientemente causó revuelo con un video que pretendía mostrar las capacidades de Géminis y que resultó haber sido muy manipulado y era más o menos aspiracional.
Aún así, suponiendo que Google sea más o menos sincero con sus afirmaciones, esto es lo que los diferentes niveles de Gemini podrán hacer una vez que alcancen su máximo potencial:
Géminis Ultra
Google dice que Gemini Ultra, gracias a su multimodalidad, puede usarse para ayudar con cosas como tareas de física, resolver problemas paso a paso en una hoja de trabajo y señalar posibles errores en respuestas ya completadas.
Gemini Ultra también se puede aplicar a tareas como identificar artículos científicos relevantes para un problema particular, dice Google: extraer información de esos artículos y «actualizar» un gráfico de uno generando las fórmulas necesarias para recrear el gráfico con datos más recientes. .
Gemini Ultra técnicamente admite la generación de imágenes, como se mencionó anteriormente. Pero esa capacidad aún no ha llegado a la versión productiva del modelo, tal vez porque el mecanismo es más complejo que la forma en que aplicaciones como ChatGPT generan imágenes. En lugar de enviar mensajes a un generador de imágenes (como DALL-E 3, en el caso de ChatGPT), Gemini genera imágenes «de forma nativa», sin un paso intermedio.
Gemini Ultra está disponible como API a través de Vertex AI, la plataforma de desarrollo de IA totalmente administrada de Google, y AI Studio, la herramienta web de Google para desarrolladores de aplicaciones y plataformas. También impulsa las aplicaciones Gemini, pero no de forma gratuita. El acceso a Gemini Ultra a través de lo que Google llama Gemini Advanced requiere suscribirse al Plan Premium Google One AI, con un precio de 20 dólares al mes.
El plan AI Premium también conecta Gemini con su cuenta más amplia de Google Workspace: piense en correos electrónicos en Gmail, documentos en Docs, presentaciones en Sheets y grabaciones de Google Meet. Esto es útil, por ejemplo, para resumir correos electrónicos o hacer que Gemini capture notas durante una videollamada.



