El Data-Centric Sampler utiliza meta-learning para identificar los datos más relevantes para entrenar modelos de IA, reduciendo costos computacionales y su huella de carbono.
Proyecto Automaise Sustainable AI Platform
Durante años, el mundo de la Inteligencia Artificial funcionó con una creencia casi religiosa: cuantos más datos, mejor. Más datos de entrenamiento significaban modelos más precisos, más robustos, más capaces. Era una regla no escrita que impulsó inversiones masivas en infraestructura, almacenamiento y poder computacional.
¿El problema? Esta regla está siendo cuestionada por la propia ciencia.
Estudios recientes han demostrado que, en muchos contextos, la calidad de los datos supera a la cantidad. Un conjunto de datos menor, pero más representativo y bien seleccionado, puede producir resultados comparables, o superiores, a un conjunto masivo y ruidoso. Esta es la idea que fundamenta el movimiento data-centric AI, y es también el principio que guía el desarrollo del Data-Centric Sampler.
¿Qué es el Data-Centric Sampler?
El Data-Centric Sampler es un módulo que estamos integrando en nuestra plataforma con un objetivo claro: crear muestras eficientes de datos para el entrenamiento de modelos de IA, reduciendo drásticamente la cantidad de datos necesaria sin comprometer la calidad de los resultados.
En términos sencillos, en vez de entrenar un modelo con el 100% de los datos disponibles, el Data-Centric Sampler identifica los ejemplos más informativos, aquellos que realmente enseñan algo al modelo, y construye una muestra optimizada. El modelo aprende más, con menos.
La innovación: meta-learning aplicado al muestreo
Lo que hace que el Data-Centric Sampler sea verdaderamente innovador es el enfoque técnico que le subyace: el meta-learning.
El meta-learning, o "aprender a aprender", es una rama de la IA en la que los sistemas desarrollan la capacidad de adaptar estrategias de aprendizaje basándose en experiencias anteriores. Aplicado al muestreo de datos, permite al sistema comprender, a partir de múltiples conjuntos de datos y casos de uso, qué tipo de ejemplos son más valiosos para entrenar un modelo determinado en una tarea específica.
Estamos en una posición privilegiada para desarrollar esta tecnología. Nuestra plataforma procesa datos de clientes en sectores muy diversos, como contact centers, aseguradoras, retail, energía y banca, lo que genera un valioso efecto de red: cuantos más casos de uso se procesan, más aprende el sistema sobre qué datos marcan realmente la diferencia.
Esta es una investigación que difícilmente podría llevarse a cabo en un contexto puramente académico, precisamente porque los datos industriales —más ruidosos, mayores y más complejos que los datos de investigación open-source— son el entorno donde estas técnicas necesitan ser probadas y validadas.
¿Qué esperamos lograr?
Los objetivos del Data-Centric Sampler son cuantificables y verificables:
Reducción de al menos un 40% en el tamaño del conjunto de datos necesario para entrenar modelos de IA con un rendimiento equivalente.
Reducción de al menos un 30% en la complejidad de los modelos resultantes, gracias a una mejor calidad de los datos de entrenamiento.
Menor coste computacional en el desarrollo y mantenimiento de soluciones, con ahorros estimados de al menos un 30% en los costes de infraestructura cloud.
El impacto en el mundo real
Para un cliente que desarrolla un asistente virtual en nuestra plataforma, esto se traduce en experiencias concretas:
Menor tiempo de experimentación. El proceso de fine-tuning se vuelve más rápido porque el sistema ya sabe qué datos utilizar.
Menor dependencia de GPUs costosas. Entrenar modelos con menos datos reduce la necesidad de infraestructura de alto coste. Un servidor con GPU Nvidia A100 cuesta alrededor de 2.200 € al mes en plataformas cloud como Azure o Google Cloud. Reducir el tiempo de entrenamiento significa reducir directamente este coste.
Menor huella de carbono. Menos computación significa menos emisiones. El Data-Centric Sampler es, por tanto, también una herramienta de sostenibilidad.
Una contribución a la comunidad
Nos comprometemos a lanzar el Data-Centric Sampler como una librería Python de código abierto, compatible con la popular librería Pandas. Esto significa que cualquier equipo de ciencia de datos, en cualquier parte del mundo, podrá beneficiarse de esta investigación, sin barreras de acceso.
Creemos que hacer la IA más eficiente es un bien público. Y que compartir el conocimiento desarrollado es parte integrante de esta misión.
El Data-Centric Sampler es uno de los tres módulos del proyecto Automaise Sustainable AI Platform, cofinanciado por Portugal 2030 y la Unión Europea a través del programa COMPETE 2030. En el próximo artículo, presentaremos el AI Carbon Emissions Calculator, la herramienta que mide la huella de carbono de las soluciones de IA antes incluso de que estas sean desarrolladas.




