
En los últimos meses, los modelos de lenguaje grandes, o LLMs, como chatGPT, han causado sensación en el mundo. Ya sea escribiendo poesía o ayudando a planificar tus próximas vacaciones, estamos viendo un cambio radical en el rendimiento de la IA y su potencial para impulsar el valor empresarial. Mi nombre es Kate Soule. Soy gerente senior de estrategia empresarial en IBM Research y hoy daré una breve descripción de este nuevo campo de IA que está emergiendo y cómo se puede utilizar en un entorno empresarial para generar valor.
Índice
Modelos de Fundación
Ahora bien, los LLMs en realidad son parte de una clase diferente de modelos llamados modelos de fundación. El término «modelos de fundación» fue acuñado por primera vez por un equipo de Stanford cuando observaron que el campo de la IA estaba convergiendo hacia un nuevo paradigma. Antes, las aplicaciones de IA se construían entrenando una biblioteca de modelos de IA diferentes, donde cada modelo se entrenaba con datos muy específicos de la tarea para realizar una tarea muy específica. Predijeron que íbamos a empezar a pasar a un nuevo paradigma, donde tendríamos una capacidad fundamental, o un modelo de fundación, que impulsaría todos estos mismos casos de uso y aplicaciones. Es decir, las mismas aplicaciones que imaginábamos antes con la IA convencional, y el mismo modelo podría impulsar cualquier número adicional de aplicaciones. El punto es que este modelo podría ser transferido a cualquier número de tareas. Lo que le da a este modelo el superpoder de poder transferirse a múltiples tareas diferentes y realizar múltiples funciones diferentes es que se ha entrenado en una gran cantidad de datos no supervisados y desestructurados. Y lo que eso significa, en el dominio del lenguaje, es básicamente que se le alimenta un montón de oraciones, y estoy hablando de terabytes de datos aquí, para entrenar este modelo. Y el inicio de mi oración podría ser «no vale la pena llorar por la leche derramada» y el final de mi oración podría ser «milk» (leche). Y estoy tratando de hacer que mi modelo prediga la última palabra de la oración en función de las palabras que ha visto antes. Y es esta capacidad generativa del modelo, de predecir y generar la siguiente palabra en función de las palabras anteriores que ha visto, lo que explica por qué los modelos de fundación son en realidad parte del campo de la IA llamado IA generativa porque estamos generando algo nuevo en este caso, la siguiente palabra en una oración. Y aunque estos modelos están entrenados para realizar, en su núcleo, una generación pasada, es decir, predecir la siguiente palabra en la oración, en realidad podemos tomar estos modelos y, si introducimos una pequeña cantidad de datos etiquetados en la ecuación, podemos ajustarlos para realizar tareas tradicionales de procesamiento de lenguaje natural, como clasificación o reconocimiento de entidades con nombre, cosas que normalmente no asociaríamos con un modelo o una capacidad basada en la generación. Y este proceso se llama ajuste. Es decir, puedes ajustar tu modelo de fundación introduciendo una pequeña cantidad de datos, actualizas los parámetros de tu modelo y ahora realiza una tarea muy específica de lenguaje natural. Si no tienes datos o solo tienes muy pocos puntos de datos, aún puedes tomar estos modelos de fundación y funcionarán muy bien en dominios con pocos datos etiquetados. Y en un proceso llamado formulación o ingeniería de preguntas, puedes aplicar estos modelos para algunas de esas mismas tareas. Por ejemplo, puedes darle al modelo una oración y luego hacerle una pregunta: ¿La oración tiene un sentimiento positivo o negativo? El modelo intentará completar la generación de palabras en esa oración y la siguiente palabra natural en esa oración sería la respuesta a tu problema de clasificación, que respondería ya sea positivo o negativo, dependiendo de dónde estime el sentimiento de la oración. Y estos modelos funcionan sorprendentemente bien cuando se aplican en estos nuevos entornos y dominios.
Ventajas y Desventajas
Ahora bien, aquí es donde entran en juego las ventajas de los modelos de fundación. Si hablamos de ventajas, la principal es el rendimiento. Estos modelos han visto tantos datos. Una vez más, datos con mayúsculas: terabytes de datos. Que cuando se aplican a tareas pequeñas, pueden superar drásticamente a un modelo que solo se entrenó con unos pocos puntos de datos. La segunda ventaja de estos modelos son las ganancias de productividad. Como mencioné anteriormente, a través de la formulación o el ajuste, se necesita mucho menos datos etiquetados para obtener un modelo específico de la tarea que si tuvieras que comenzar desde cero, porque tu modelo está aprovechando todos los datos no etiquetados que vio durante su pre-entrenamiento cuando creamos esta tarea generativa. Con estas ventajas, también hay algunas desventajas importantes a tener en cuenta. Y la primera de ellas es el costo informático. El problema de que este modelo vea tantos datos es que es muy costoso entrenarlos, lo que dificulta a las empresas más pequeñas entrenar un modelo de fundación por sí mismas. También son costosos, cuando alcanzan un gran tamaño, un par de miles de millones de parámetros, también son muy costosos de ejecutar en inferencia. Es posible que se requieran múltiples GPUs a la vez para alojar estos modelos y ejecutar inferencias, lo que los convierte en un método más costoso que los enfoques tradicionales. La segunda desventaja de estos modelos está relacionada con la confiabilidad. Así como los datos son una gran ventaja para estos modelos, ya que han visto muchos datos no estructurados, también tienen un costo, especialmente en el dominio del lenguaje. Muchos de estos modelos se entrenan básicamente con datos de lenguaje que se han extraído de Internet. Y han sido entrenados con muchos de estos datos. Incluso si tuvieras un equipo completo de anotadores humanos, no podrías revisar cada punto de datos individual para asegurarte de que no estén sesgados o contengan discursos de odio u otra información tóxica. Y eso es asumiendo que realmente conoces los datos. A menudo ni siquiera sabemos, en muchos de estos modelos de código abierto que se han publicado, cuáles son los conjuntos exactos de datos en los que se han entrenado, lo que lleva a problemas de confiabilidad. Por eso, IBM reconoce el enorme potencial de estas tecnologías. Pero mis colegas en IBM Research están trabajando en múltiples innovaciones para tratar de mejorar también la eficiencia y la confiabilidad de estos modelos, para que sean más relevantes en un entorno empresarial.
Otros Dominios de Aplicación
Todos los ejemplos que he mencionado hasta ahora han sido en el ámbito del lenguaje. Pero la realidad es que hay muchos otros dominios en los que se pueden aplicar los modelos de fundación. Famosamente, hemos visto modelos de fundación para la visión, como DALL-E 2, que utiliza datos de texto para generar imágenes personalizadas. Hemos visto modelos para el código, como Copilot, que puede ayudar a completar el código mientras se está escribiendo. Y en IBM estamos innovando en todos estos dominios. Ya sea con modelos de lenguaje que estamos incorporando en productos como Watson Assistant y Watson Discovery, modelos de visión que estamos incorporando en productos como Maximo Visual Inspection, o modelos de código Ansible que estamos desarrollando con nuestros socios de Red Hat en el Proyecto Wisdom. Estamos innovando en todos estos dominios y más. Estamos trabajando en química. Por ejemplo, acabamos de publicar y lanzar Molformer, que es un modelo de fundación para promover el descubrimiento de moléculas o terapéuticas específicas. Y estamos trabajando en modelos para el cambio climático, creando modelos de fundación de ciencias de la Tierra utilizando datos geoespaciales para mejorar la investigación climática.
Espero que hayas encontrado este artículo informativo y útil. Si estás interesado en aprender más, especialmente cómo IBM está trabajando para mejorar algunas de estas desventajas, haciendo que los modelos de fundación sean más confiables y eficientes, echa un vistazo a los enlaces a continuación. Gracias.
Resumen del Artículo
| Ventajas | Desventajas |
|---|---|
| Rendimiento superior al estar entrenados en grandes cantidades de datos | Costo computacional elevado tanto en entrenamiento como inferencia |
| Productividad mejorada al requerir menos datos etiquetados | Potenciales problemas de confiabilidad como sesgos o información tóxica |
Preguntas Frecuentes
1. ¿Qué es un modelo de fundación?
Un modelo de fundación es una clase de modelos de lenguaje grandes que pueden transferirse a múltiples tareas y dominios debido a su entrenamiento con grandes cantidades de datos no supervisados en forma generativa.
2. ¿Cuáles son las ventajas de los modelos de fundación?
Las ventajas principales de los modelos de fundación son su rendimiento superior debido a la gran cantidad de datos que han sido entrenados y su productividad mejorada al requerir menos datos etiquetados para tareas específicas.
3. ¿Cuáles son las desventajas de los modelos de fundación?
Las desventajas de los modelos de fundación son su costo computacional elevado tanto en entrenamiento como en inferencia, así como posibles problemas de confiabilidad debido a la naturaleza de los datos de entrenamiento.
4. ¿En qué otros dominios se pueden aplicar los modelos de fundación?
Además del lenguaje, los modelos de fundación también se pueden aplicar en dominios como la visión y el código, entre otros. IBM está trabajando en innovaciones en todos estos dominios y más.
5. ¿Cómo está abordando IBM las desventajas de los modelos de fundación?
IBM Research está trabajando en diversas innovaciones para mejorar la eficiencia y la confiabilidad de los modelos de fundación, haciendo que sean más relevantes en entornos empresariales.
Si estás interesado en obtener más información sobre cómo IBM está trabajando en mejorar los modelos de fundación, te invitamos a consultar los enlaces a continuación.
¡Gracias por leer nuestro artículo! No olvides visitar nuestros artículos relacionados para obtener más información sobre este fascinante tema.
¿Te ha resultado útil??
0 / 0

Hola, somos Mila Jiménez y César Sánchez. Dos apasionados de la ciberseguridad con muchos años de experiencia. Hemos trabajado en muchas empresas del mundo TI y ahora nos apetece compartir nuestro conocimiento con cualquiera que lo necesite.
¡Si te gusta nuestro contenido puedes invitarnos a un café AQUÍ!