El zero-shot learning permite a los modelos de IA resolver tareas para las que no han recibido ejemplos de en­tre­na­mie­n­to. De este modo, los sistemas ganan fle­xi­bi­li­dad, se adaptan con mayor rapidez y se acercan a una verdadera “in­te­li­ge­n­cia general ar­ti­fi­cial”.

¿Qué es el zero-shot learning?

El zero-shot learning es un método de apre­n­di­za­je au­to­má­ti­co en el que un modelo de IA aborda clases o tareas que no forman parte explícita de su en­tre­na­mie­n­to. En lugar de necesitar ejemplos concretos, el modelo utiliza de­s­cri­p­cio­nes se­má­n­ti­cas, atributos o in­di­ca­cio­nes en lenguaje natural. Así, puede inferir conceptos de­s­co­no­ci­dos a partir de los ya conocidos.

El zero-shot learning puede en­te­n­de­r­se como una forma de “in­fe­re­n­cia in­te­li­ge­n­te”, basada en co­no­ci­mie­n­to es­tru­c­tu­ra­do en lugar de azar. El modelo establece re­la­cio­nes entre el si­g­ni­fi­ca­do aprendido y nuevos términos objetivo. Este enfoque resulta es­pe­cia­l­me­n­te útil en ámbitos con muchas clases o clases poco fre­cue­n­tes, donde no suele haber su­fi­cie­n­tes datos de en­tre­na­mie­n­to. Así permite un uso mucho más eficiente de los datos y amplía co­n­si­de­ra­ble­me­n­te las apli­ca­cio­nes de la in­te­li­ge­n­cia ar­ti­fi­cial.

He­rra­mie­n­tas de IA
Aprovecha al máximo la in­te­li­ge­n­cia ar­ti­fi­cial
  • Crea tu página web en tiempo récord
  • Impulsa tu negocio gracias al marketing por IA
  • Ahorra tiempo y obtén mejores re­su­l­ta­dos

¿Cómo funciona el zero-shot learning?

El zero-shot learning funciona mediante los llamados espacios se­má­n­ti­cos. Se trata de espacios ma­te­má­ti­cos en los que los si­g­ni­fi­ca­dos se re­pre­se­n­tan como vectores numéricos. Dicho de forma sencilla: palabras, pro­pie­da­des o de­s­cri­p­cio­nes se re­pre­se­n­tan de modo que los si­g­ni­fi­ca­dos similares queden cerca entre sí. Las nuevas clases o tareas se integran en este espacio mediante de­s­cri­p­cio­nes textuales, atributos o ejemplos en lenguaje natural. Al mismo tiempo, el modelo convierte imágenes, archivos de audio u otras entradas en vectores co­m­pa­ra­bles. Así, todos los tipos de datos, ya sean texto o imagen, se re­pre­se­n­tan en un mismo espacio semántico.

A co­n­ti­nua­ción, el modelo busca la de­s­cri­p­ción se­má­n­ti­ca­me­n­te más adecuada para una nueva entrada y la asigna en co­n­se­cue­n­cia. Aquí la capacidad mu­l­ti­mo­dal desempeña un papel central: el modelo puede vincular in­fo­r­ma­ción de distintas fuentes, por ejemplo, texto e imagen. Los sistemas de zero-shot learning utilizan a menudo modelos de tipo Tra­n­s­fo­r­mer, que procesan de forma eficiente tanto el lenguaje como los co­n­te­ni­dos visuales y los co­n­vie­r­ten en re­pre­se­n­ta­cio­nes comunes.

Durante el en­tre­na­mie­n­to, la IA aprende qué patrones, si­g­ni­fi­ca­dos y re­la­cio­nes son típicos de de­te­r­mi­na­dos conceptos o tareas. En la fase de zero-shot, solo le pro­po­r­cio­nas al modelo un prompt en lenguaje natural que describe lo que debe hacer. La IA utiliza entonces su co­no­ci­mie­n­to acumulado del lenguaje y del mundo para resolver la nueva tarea sin ejemplos de en­tre­na­mie­n­to es­pe­cí­fi­cos. Es clave que el modelo no solo reconozca patrones su­pe­r­fi­cia­les, sino que también relacione los si­g­ni­fi­ca­dos de forma lógica. De este modo, puede abordar tareas complejas o ab­s­tra­c­tas.

¿Qué tipos de zero-shot learning existen?

El zero-shot learning existe en varias variantes, que se di­fe­re­n­cian en cómo utilizan y combinan la in­fo­r­ma­ción. En esencia, todas buscan co­m­pre­n­der clases de­s­co­no­ci­das, pero cada una emplea su propio mecanismo para lograrlo.

Zero-shot learning basado en atributos

En este método, las clases se describen mediante listas de atributos, por ejemplo, “tiene rayas”, “cuatro patas” o “vive en el agua”. El modelo aprende primero a reconocer estos atributos y, a co­n­ti­nua­ción, asigna objetos de­s­co­no­ci­dos a las co­m­bi­na­cio­nes de atributos co­rre­s­po­n­die­n­tes. Esta variante fue una de las primeras formas de zero-shot learning y es es­pe­cia­l­me­n­te adecuada para tareas de cla­si­fi­ca­ción visual. Sin embargo, requiere conjuntos de atributos bien definidos y cohe­re­n­tes. El enfoque es preciso, pero poco flexible.

Zero-shot learning basado en espacios ve­c­to­ria­les

En el zero-shot learning basado en vectores, tanto los datos de entrada como las de­s­cri­p­cio­nes se re­pre­se­n­tan en un espacio vectorial común. El modelo intenta entonces encontrar la re­pre­se­n­ta­ción semántica que mejor encaje. Este método co­n­s­ti­tu­ye la base de modelos mu­l­ti­mo­da­les modernos como CLIP. Su principal ventaja es la fle­xi­bi­li­dad y es­ca­la­bi­li­dad. Además, puede procesar lenguaje natural y datos no es­tru­c­tu­ra­dos sin problemas. Sin embargo, su re­n­di­mie­n­to depende en gran medida de la calidad de las re­pre­se­n­ta­cio­nes (em­be­d­di­n­gs).

Zero-shot learning ge­ne­ra­ti­vo

La IA ge­ne­ra­ti­va como los GAN o los modelos de difusión genera ejemplos ar­ti­fi­cia­les de clases de­s­co­no­ci­das a partir de su de­s­cri­p­ción. De este modo, el zero-shot learning puede tra­n­s­fo­r­mar­se pa­r­cia­l­me­n­te en un enfoque similar al few-shot learning sintético. Este método resulta es­pe­cia­l­me­n­te útil para cubrir lagunas de en­tre­na­mie­n­to, por ejemplo, cuando los datos reales son escasos o no están di­s­po­ni­bles. No obstante, existe el riesgo de que los ejemplos generados incluyan re­pre­se­n­ta­cio­nes erróneas o sesgadas.

Ámbitos de apli­ca­ción del zero-shot learning

El zero-shot learning se aplica en numerosos ámbitos en los que la fle­xi­bi­li­dad es más im­po­r­ta­n­te que disponer de grandes volúmenes de datos:

  • Visión por co­mpu­tador (computer vision): en este campo, el zero-shot learning permite cla­si­fi­car objetos raros o nuevos sin necesidad de datos de en­tre­na­mie­n­to adi­cio­na­les.
  • Pro­ce­sa­mie­n­to del lenguaje natural: se utiliza para reconocer nuevas ca­te­go­rías de se­n­ti­mie­n­to o temas sin necesidad de anotación manual.
  • Sistemas de re­co­me­n­da­ción: ayuda a asignar de inmediato nuevos productos o co­n­te­ni­dos sin datos hi­s­tó­ri­cos previos.
  • Robótica: permite a los robots co­m­pre­n­der nuevas tareas sin necesidad de de­mo­s­tra­cio­nes previas.
  • Medicina: puede ide­n­ti­fi­car cuadros clínicos que solo se han descrito de forma textual.

Además, el zero-shot learning desempeña un papel central en los modelos de lenguaje de gran tamaño (LLM), que deben in­te­r­pre­tar co­n­ti­nua­me­n­te nuevas tareas y formatos. Asimismo, este enfoque puede ayudar a los sistemas de ci­be­r­se­gu­ri­dad a ide­n­ti­fi­car formas de ataque hasta ahora de­s­co­no­ci­das.

IONOS CLOUD AI Model Hub
Tu pla­ta­fo­r­ma de IA mu­l­ti­mo­dal segura
  • Una pla­ta­fo­r­ma diseñada para los modelos de IA más potentes
  • Precios justos y tra­n­s­pa­re­n­tes basados en tokens
  • Código abierto, sin vendor lock-in

Ventajas y de­s­ve­n­ta­jas del zero-shot learning

El zero-shot learning es un enfoque potente, pero no exento de co­m­ple­ji­dad. Aunque ofrece grandes ventajas en términos de fle­xi­bi­li­dad, también depende en gran medida de una semántica fiable y de re­pre­se­n­ta­cio­nes de datos robustas.

Ventajas del zero-shot learning

El apre­n­di­za­je zero-shot permite reconocer clases co­m­ple­ta­me­n­te nuevas sin necesidad de datos de en­tre­na­mie­n­to adi­cio­na­les. De este modo, los modelos requieren menos datos, son más efi­cie­n­tes y pueden de­s­ple­gar­se con mayor rapidez. Las empresas pueden im­ple­me­n­tar sistemas sin necesidad de realizar largas fases de re­co­pi­la­ción de datos ni procesos de eti­que­ta­do costosos. Además, la capacidad de ge­ne­ra­li­za­ción de la IA aumenta de forma si­g­ni­fi­ca­ti­va, algo clave en entornos dinámicos. Los modelos reac­cio­nan mejor a los cambios y requieren menos ma­n­te­ni­mie­n­to. Asimismo, el apre­n­di­za­je zero-shot abre nuevas áreas de apli­ca­ción que el apre­n­di­za­je au­to­má­ti­co clásico no puede cubrir.

De­s­ve­n­ta­jas del zero-shot learning

La principal de­s­ve­n­ta­ja es que el apre­n­di­za­je zero-shot depende en gran medida de la calidad de la in­fo­r­ma­ción semántica. Los errores en las de­s­cri­p­cio­nes o en los em­be­d­di­n­gs pueden dar lugar a asi­g­na­cio­nes in­co­rre­c­tas. Asimismo, existe el riesgo de sesgos se­má­n­ti­cos, ya que los modelos pueden trasladar los sesgos presentes en los datos de en­tre­na­mie­n­to a las nuevas clases. Los modelos de zero-shot learning (ZSL) también son más difíciles de evaluar, porque no existen ejemplos reales de en­tre­na­mie­n­to para las clases objetivo. En ámbitos críticos para la seguridad, la in­ce­r­ti­du­m­bre sobre su fia­bi­li­dad puede resultar pro­ble­má­ti­ca. Por último, la im­ple­me­n­ta­ción del apre­n­di­za­je zero-shot es té­c­ni­ca­me­n­te exigente, es­pe­cia­l­me­n­te cuando in­te­r­vie­nen datos mu­l­ti­mo­da­les.

Ventajas y de­s­ve­n­ta­jas del zero-shot learning de un vistazo

Ventajas De­s­ve­n­ta­jas
No requiere ejemplos de en­tre­na­mie­n­to para nuevas clases Alta de­pe­n­de­n­cia de la calidad semántica
Ahorra costes y tiempo en la ge­ne­ra­ción de datos Riesgo de sesgos e in­te­r­pre­ta­cio­nes erróneas
Alta capacidad de ge­ne­ra­li­za­ción Eva­lua­ción compleja de nuevas clases
Gran fle­xi­bi­li­dad en entornos dinámicos Ar­qui­te­c­tu­ras de modelos té­c­ni­ca­me­n­te complejas
Permite apli­ca­cio­nes con conceptos raros o nuevos Limitado en entornos críticos para la seguridad
Ir al menú principal