Educación Superior / Investigación
Los investigadores de la Ohio State University están digitalizando organismos vivos para amplios esfuerzos de ciencia y conservación a través de BioCLIP 2, un modelo fundacional del Árbol de la vida para la mitad de las especies con nombre del mundo. Este modelo se entrenó con el conjunto de datos más grande y diverso creado hasta la fecha, TreeOfLife-200M, ensamblado por el mismo equipo.
Para enfrentar las brechas de datos de especies globales, los investigadores usaron GPU NVIDIA A100 y H100 para desarrollar BioCLIP 2, logrando así los mejores o los dos mejores desempeños para la identificación de especies y el reconocimiento zero-shot de casi un millón de taxones. El modelo permite obtener información ecológica y evolutiva emergente. BioCLIP 2 se presentó recientemente en la conferencia anual de investigación de IA de NeurIPS.
Universidad Estatal de Ohio
Simulación / Modelado / Diseño
Resultados Clave
La biodiversidad proporciona servicios ecosistémicos esenciales como agua limpia, aire respirable y suelo productivo. Para estudiar, comprender y administrar adecuadamente los ecosistemas a fin de monitorear y proteger la biodiversidad del mundo, los investigadores necesitan tener buenos datos.
Sin embargo, la comunidad científica enfrenta un problema significativo en cuanto a datos de biodiversidad: los datos faltantes y sesgados. La calidad y profundidad de los datos biológicos suelen estar vinculadas a la presencia y al nivel de riqueza de las poblaciones humanas locales. Esto implica que se generan datos muy concentrados en áreas urbanas y parques nacionales. Los lugares importantes, como los trópicos, estaban subrepresentados.
Desde una perspectiva taxonómica, los vertebrados (especialmente los mamíferos y las aves) tienen datos abundantes, pero los invertebrados y los hongos carecen de información integral. Por ejemplo, la mitad de las 160,000 especies monitoreadas por la Lista Roja de la Unión Internacional para la Conservación de la Naturaleza (IUCN) tiene datos insuficientes, incluidas algunas especies importantes como las orcas.
Anteriormente, la falta de datos integrales y equilibrados dificultaba la comprensión de impactos ambientales a largo plazo, de relaciones evolutivas y de interacciones ecológicas.
Las gráficas de dispersión comienzan a mostrar especies de plantas mejor separadas a medida que se va entrenando el modelo. Las variaciones internas de cada especie también forman clústeres, lo que las hace más fáciles de separar.
Tanya Berger-Wolf, directora del Translational Data Analytics Institute y profesora de The Ohio State University, lideró un equipo en el Imageomics Institute, financiado por la National Science Foundation de los EE. UU., para abordar la brecha de datos. El equipo desarrolló el conjunto de datos de biología más grande e integral disponible y entrenó un modelo fundacional mediante estos datos.
Los esfuerzos iniciales del equipo, que usaron etiquetas taxonómicas jerárquicas y el entrenamiento contrastante al estilo de CLIP, lograron una precisión de clasificación de especies pronunciada en aproximadamente una cuarta parte de las especies con nombre del mundo. Sin embargo, no estaba claro qué propiedades surgirían al escalar estos métodos. Los conjuntos de datos biológicos a gran escala existentes como TreeOfLife-10M y BioTrove también tenían limitaciones en términos de escala y diversidad, lo que afectaba la capacidad de generalización del modelo.
Los modelos de IA desarrollados con anterioridad a menudo se limitaban a objetivos puntuales como la clasificación de especies, por lo que no podían abordar tareas visuales más amplias (como la clasificación de hábitats o la predicción de rasgos) sin un entrenamiento explícito. Además, al equipo le preocupaba que el entrenamiento extenso pudiera causar que las variaciones dentro de la especie (como las etapas de vida o los sexos) colapsaran, lo que dificultaba la tarea de hacer distinciones precisas.
Los investigadores necesitaban aumentar masivamente el tamaño de su conjunto de datos y entrenar un nuevo modelo en un entorno estabilizado que aún pudiera hacer distinciones granulares en los datos biológicos.
Las GPU de alto desempeño de NVIDIA proporcionaron la potencia de procesamiento paralelo necesaria para cada paso de la selección de conjuntos de datos TreeOfLife-200M y el entrenamiento de modelos BioCLIP 2.
Antes de que el entrenamiento pudiera comenzar, TreeOfLife-200M debía desarrollarse. La selección de este conjunto de datos implicó combinar fuentes vastas y dispares —como Global Biodiversity Information Facility (GBIF), Encyclopedia of Life (EOL), BIOSCAN-5M y FathomNet— y el desarrollo de un paquete de alineación taxonómica personalizado, TaxonoPy, para estandarizar 1.36 millones de jerarquías taxonómicas ruidosas a 952,000 taxones únicos. Este conjunto de datos se recuperó y organizó mediante herramientas de descarga distribuida, que se almacenaron en sistemas de archivos de computación de alto desempeño (HPC), lo que indica un pipeline de datos sólido diseñado para alimentar a múltiples GPU de manera eficiente.
Una vez que el conjunto de datos se completó, el entrenamiento comenzó a utilizar una variedad de GPU de NVIDIA para desarrollar BioCLIP 2:
"Las GPU de NVIDIA, conocidas por sus capacidades para acelerar la IA y la investigación científica, fueron parte esencial del proceso de hacer posibles estos descubrimientos al ofrecer el eje computacional necesario".
Tanya Berger-Wolf
Directora del Instituto de Análisis de Datos Traslacionales en la Universidad Estatal de Ohio
Los investigadores descubrieron un profundo potencial científico a través del entrenamiento y el desarrollo de BioCLIP 2. Los modelos fundacionales entrenados a escala muestran comportamientos emergentes notables, aprendiendo nuevas capacidades más allá de sus objetivos de entrenamiento iniciales.
Contrariamente a la expectativa de que las diferencias detalladas pudieran colapsar después de un entrenamiento extenso, BioCLIP 2 preservó las variaciones dentro de la especie. Esto permite al modelo diferenciar y alinear estas variantes. Por ejemplo, puede agrupar diferentes enfermedades de plantas en hojas dentro de la misma especie de planta y distinguir entre ejemplares juveniles y adultos o machos y hembras dentro de una sola especie animal.
La distribución de incrustación de diferentes especies se alineó espontáneamente con sus relaciones ecológicas sin entrenamiento explícito. Por ejemplo, el modelo capturó las variaciones en los tamaños de pico entre los pinzones de Darwin y distinguió entre las especies de peces de agua dulce y las especies de peces que no son de agua dulce.
Además, BioCLIP 2 (entrenado con las GPU de NVIDIA) superó a sus predecesores en numerosas categorías, entre ellas:
Las capacidades de BioCLIP 2 presentan oportunidades significativas para un mayor descubrimiento científico, la investigación de la biodiversidad y la toma de decisiones de conservación mediante la IA. El modelo permite workflows científicos más eficientes y automatizados, lo que abre nuevas vías para comprender las relaciones funcionales y ecológicas entre las especies.
Más información sobre cómo la computación acelerada de NVIDIA puede ayudar a lograr avances científicos a velocidades sin precedentes.