Participa con tu nota. Contacto: [email protected]

Editorial

Objetivo: Etiquetar el infinito para aprender del humano

Los sistemas inteligentes adquieren buena parte de su habilidad semántica de las guías que los humanos damos a través de una actividad denominada etiquetado. Pero los datos son tantos y tan diversos que se dificulta cualquier enseñanza razonable. ¿Cómo se resuelve este problema?


Aprender desde conjuntos de datos originados de entornos no diversos y divergentes es vital para muchos de las aplicaciones del mundo real. Un desafío notable de esta tarea es la correcta extracción conceptual subyacente. La mayoría de los métodos se basan en una cantidad importante de instancias etiquetadas por humanos para poder detectar y manejar los conceptos insertos en los conjuntos textuales.

Sin embargo, el mero hecho de construir datos etiquetados tampoco es algo simple dado los altos costos que ello implica, especialmente si se considera que los datos que se generan son potencialmente infinitos a partir de las fuentes que se consideran.

Para resolver esta complicación los científicos están explorando la posibilidad de usar una red neuronal que tenga la habilidad de aprender activamente con datos semi-supervisados, esto es con información incompleta. Esto permite clasificar aquellos casos que nunca recibieron etiqueta, simplemente usando ese modelo neuronal.

Primero se debe realizar un proceso denominado regularización de datos, algo así como hacer que lo que vamos a procesar se pueda interpretar con los mismos criterios. Por supuesto eso también se realiza con un proceso semi-supervisado bajo una hipótesis de suavizar las diferencias lo mejor posible para que no existan grandes saltos entre lo conocido y lo nuevo. Dicho de otro modo, la red neuronal que aprenderá a etiquetar podrá ser ajustada desde sus conexiones internas hasta que pueda emplear datos que no hayan sido etiquetados y clasificarlos razonablemente bien.

Luego se genera una estrategia de consulta y selección de datos (normalmente conocida como query) con base en técnicas de suavizado con pérdida de precisión. Esto permite que la selección sea más rápida y ante dudas no deje fuera casos que podrían ser de interés.

En particular, la estrategia de consulta y la regularización semi-supervisada propuesta por los investigadores posiblemente formen un bucle de aprendizaje cerrado que realice la mejora mutua del aprendizaje semi-supervisado y el aprendizaje activo más poderoso para aprendizajes masivos que lo métodos tradicionales. Además, se propone un método de ajuste de nodos internos a la red, que ajusta solo unas pocas neuronas para adaptarse a los cambios locales. Experimentos en 17 conjuntos de datos sintéticos y del mundo real muestran que el método propuesto supera a otros métodos de vanguardia. Por supuesto todo esto bajo varios presupuestos de etiquetado pero al menos es un paso adelante para superar la maldición de los datos inabarcables.


Daniela López De Luise

Sociedad Científica Argentina
IEEE CIS Argentina
CI2S Labs

Fuente

B.Jiao et al. A semi-Supervised Active Learning Neural Network for Data Streams With Concept Drift. IEEE COMPUTATIONAL INTELLIGENCE MAGAZINE | FEBRUARY 2025. 1556-603X ß 2025 IEEE. PP 18 – 32