Nivel técnico del artículo

En los últimos años, la inteligencia artificial (IA) ha transformado múltiples sectores gracias a su capacidad para detectar patrones complejos en grandes volúmenes de datos. Uno de los campos menos explotados, pero con un enorme potencial de aplicación, es la audición por computador (machine listening): el desarrollo de algoritmos capaces de extraer información útil a partir de señales de sonido. En esta línea se enmarca el nuevo proyecto de I+D de ITI, centrado en el entrenamiento y despliegue de modelos de IA para el análisis, detección y clasificación de sonidos en entornos industriales.

Este proyecto se propone trabajar sobre un problema muy concreto: cómo dotar a los sistemas tecnológicos de la capacidad de escuchar el entorno y actuar en consecuencia. No se trata de procesar lenguaje humano o música, como lo haría un asistente virtual, sino de trabajar con sonidos genéricos —desde el zumbido de un motor hasta el chasquido de una estructura metálica— cuya diversidad, origen físico y comportamiento temporal son mucho más complejos y menos predecibles.

Los modelos de IA actuales, y en particular los basados en redes neuronales, aprenden a realizar tareas mediante un proceso llamado entrenamiento. Este consiste en ajustar una gran cantidad de coeficientes internos (a menudo millones) a partir de un conjunto de datos de entrada y salida conocido. En el caso del sonido, las entradas pueden ser grabaciones de audio, y las salidas, etiquetas que indiquen qué tipo de sonido se ha detectado (una alarma, una avería, una interferencia ambiental, etc.).

Una vez entrenado, el modelo queda definido por estos coeficientes y puede generalizar lo aprendido para analizar nuevos sonidos no vistos durante el entrenamiento. Sin embargo, este proceso tiene una limitación importante: necesita una enorme cantidad de datos etiquetados, algo que no siempre está disponible.

Aquí es donde entra en juego el transfer learning o transferencia de conocimiento. Esta técnica permite reutilizar un modelo previamente entrenado y adaptarlo a una nueva tarea modificando solo una parte de sus coeficientes. El resto permanece “congelado”, lo que permite realizar esta adaptación con una cantidad mucho menor de datos.

Gracias al transfer learning, grandes modelos desarrollados por universidades o empresas tecnológicas pueden ser aprovechados por otros actores para resolver problemas específicos. Sin embargo, estos modelos suelen estar sujetos a restricciones legales que impiden su uso comercial. Por eso, ITI ha optado por desarrollar sus propios modelos desde cero, utilizando una base de datos de sonidos industriales propia, lo que garantiza libertad total para su uso y transferencia tecnológica.

El análisis de sonidos industriales tiene aplicaciones muy concretas y de alto impacto: detección de fallos mecánicos, mantenimiento predictivo, reducción de ruidos no deseados, monitorización del entorno, control de calidad en procesos, etc. En este proyecto, ITI entrena una librería de modelos de IA especializados en estas tareas, todos ellos alimentados con su base de datos de sonidos capturados en entornos reales.

Estos modelos se diseñan para ser versátiles y adaptables. Gracias a la técnica de transferencia de conocimiento, podrán ajustarse a distintos casos de uso sin necesidad de ser entrenados completamente desde cero en cada ocasión. Además, el uso de datos propios elimina posibles conflictos legales relacionados con la propiedad intelectual de los datos y modelos.

El análisis de sonidos industriales tiene aplicaciones muy concretas y de alto impacto: detección de fallos mecánicos, mantenimiento predictivo, reducción de ruidos no deseados, monitorización del entorno, control de calidad en procesos, etc. En este proyecto, ITI entrena una librería de modelos de IA especializados en estas tareas, todos ellos alimentados con su base de datos de sonidos capturados en entornos reales.

Estos modelos se diseñan para ser versátiles y adaptables. Gracias a la técnica de transferencia de conocimiento, podrán ajustarse a distintos casos de uso sin necesidad de ser entrenados completamente desde cero en cada ocasión. Además, el uso de datos propios elimina posibles conflictos legales relacionados con la propiedad intelectual de los datos y modelos.

Uno de los elementos más innovadores del proyecto es la exploración de modelos basados en principios neuromórficos, es decir, algoritmos inspirados en el funcionamiento del cerebro humano. Concretamente, se investigará la posibilidad de trabajar con Spiking Neural Networks (SNNs), un tipo de red neuronal que no procesa información en forma de valores continuos, sino mediante spikes o impulsos discretos, como lo hacen las neuronas biológicas.

Las SNNs presentan ventajas notables: bajo consumo energético, menor latencia y menor necesidad de ancho de banda, lo que las hace ideales para su implementación en dispositivos edge (aquellos que procesan la información localmente, sin necesidad de conectarse a la nube).

Una parte clave del proyecto será la codificación de la base de datos sonora de ITI en formato spike, lo que permitirá en el futuro entrenar modelos SNN directamente desde datos industriales reales. Este trabajo pionero puede allanar el camino para soluciones de machine listening de bajo consumo energético, pensadas para sistemas autónomos e inteligentes en campo.

El proyecto de ITI representa un paso decisivo hacia la creación de tecnologías inteligentes que no solo ven o leen, sino que también escuchan el entorno. Gracias a una combinación de modelos entrenados desde cero con datos propios, técnicas de transfer learning, y tecnologías neuromórficas, esta iniciativa abre nuevas posibilidades para la transformación digital en la industria.

Además de su potencial técnico, el proyecto también destaca por su enfoque estratégico: los modelos desarrollados serán plenamente transferibles a otros sectores, sin restricciones legales, y adaptables a multitud de casos de uso. Una librería de modelos de IA versátil, entrenada con datos de calidad, y pensada para el futuro de la industria 4.0.

Autor
Pedro Zucarello | Director de la línea de I+D Audio and Neuromorphic Processing en ITI

Posts relacionados