digitalización de organismos vivos

Educación Superior / Investigación

La Universidad Estatal de Ohio Transforma la Ciencia de la Conservación con Modelos Fundacionales de Biología

Objetivo

Los investigadores de la Ohio State University están digitalizando organismos vivos para amplios esfuerzos de ciencia y conservación a través de BioCLIP 2, un modelo fundacional del Árbol de la vida para la mitad de las especies con nombre del mundo. Este modelo se entrenó con el conjunto de datos más grande y diverso creado hasta la fecha, TreeOfLife-200M, ensamblado por el mismo equipo.

Para enfrentar las brechas de datos de especies globales, los investigadores usaron GPU NVIDIA A100 y H100 para desarrollar BioCLIP 2, logrando así los mejores o los dos mejores desempeños para la identificación de especies y el reconocimiento zero-shot de casi un millón de taxones. El modelo permite obtener información ecológica y evolutiva emergente. BioCLIP 2 se presentó recientemente en la conferencia anual de investigación de IA de NeurIPS.

Cliente

Universidad Estatal de Ohio

Tema

Simulación / Modelado / Diseño

Resultados Clave

  • BioCLIP 2 logró el máximo desempeño para la identificación de especies en más de 900,000 taxones con la computación acelerada de NVIDIA.

  • El modelo preservó e identificó variaciones dentro de algunas especies, sin entrenamiento explícito.

  • Entrenado mediante GPU de NVIDIA con el conjunto de datos biológicos más grande del mundo, que comprende 214 millones de imágenes.

Muchas especies, datos insuficientes

La biodiversidad proporciona servicios ecosistémicos esenciales como agua limpia, aire respirable y suelo productivo. Para estudiar, comprender y administrar adecuadamente los ecosistemas a fin de monitorear y proteger la biodiversidad del mundo, los investigadores necesitan tener buenos datos.

Sin embargo, la comunidad científica enfrenta un problema significativo en cuanto a datos de biodiversidad: los datos faltantes y sesgados. La calidad y profundidad de los datos biológicos suelen estar vinculadas a la presencia y al nivel de riqueza de las poblaciones humanas locales. Esto implica que se generan datos muy concentrados en áreas urbanas y parques nacionales. Los lugares importantes, como los trópicos, estaban subrepresentados.

Desde una perspectiva taxonómica, los vertebrados (especialmente los mamíferos y las aves) tienen datos abundantes, pero los invertebrados y los hongos carecen de información integral. Por ejemplo, la mitad de las 160,000 especies monitoreadas por la Lista Roja de la Unión Internacional para la Conservación de la Naturaleza (IUCN) tiene datos insuficientes, incluidas algunas especies importantes como las orcas.

Anteriormente, la falta de datos integrales y equilibrados dificultaba la comprensión de impactos ambientales a largo plazo, de relaciones evolutivas y de interacciones ecológicas.

Los clústeres de especies de plantas mejoran con el entrenamiento de modelos

Las gráficas de dispersión comienzan a mostrar especies de plantas mejor separadas a medida que se va entrenando el modelo. Las variaciones internas de cada especie también forman clústeres, lo que las hace más fáciles de separar.

Creación de un Modelo Fundacional para Cerrar las Brechas de Datos Críticos

Tanya Berger-Wolf, directora del Translational Data Analytics Institute y profesora de The Ohio State University, lideró un equipo en el Imageomics Institute, financiado por la National Science Foundation de los EE. UU., para abordar la brecha de datos. El equipo desarrolló el conjunto de datos de biología más grande e integral disponible y entrenó un modelo fundacional mediante estos datos.

Los esfuerzos iniciales del equipo, que usaron etiquetas taxonómicas jerárquicas y el entrenamiento contrastante al estilo de CLIP, lograron una precisión de clasificación de especies pronunciada en aproximadamente una cuarta parte de las especies con nombre del mundo. Sin embargo, no estaba claro qué propiedades surgirían al escalar estos métodos. Los conjuntos de datos biológicos a gran escala existentes como TreeOfLife-10M y BioTrove también tenían limitaciones en términos de escala y diversidad, lo que afectaba la capacidad de generalización del modelo.

Los modelos de IA desarrollados con anterioridad a menudo se limitaban a objetivos puntuales como la clasificación de especies, por lo que no podían abordar tareas visuales más amplias (como la clasificación de hábitats o la predicción de rasgos) sin un entrenamiento explícito. Además, al equipo le preocupaba que el entrenamiento extenso pudiera causar que las variaciones dentro de la especie (como las etapas de vida o los sexos) colapsaran, lo que dificultaba la tarea de hacer distinciones precisas.

Los investigadores necesitaban aumentar masivamente el tamaño de su conjunto de datos y entrenar un nuevo modelo en un entorno estabilizado que aún pudiera hacer distinciones granulares en los datos biológicos.

Escalamiento del entrenamiento de modelos con la computación acelerada de NVIDIA

 

Las GPU de alto desempeño de NVIDIA proporcionaron la potencia de procesamiento paralelo necesaria para cada paso de la selección de conjuntos de datos TreeOfLife-200M y el entrenamiento de modelos BioCLIP 2.

Antes de que el entrenamiento pudiera comenzar, TreeOfLife-200M debía desarrollarse. La selección de este conjunto de datos implicó combinar fuentes vastas y dispares —como Global Biodiversity Information Facility (GBIF), Encyclopedia of Life (EOL), BIOSCAN-5M y FathomNet— y el desarrollo de un paquete de alineación taxonómica personalizado, TaxonoPy, para estandarizar 1.36 millones de jerarquías taxonómicas ruidosas a 952,000 taxones únicos. Este conjunto de datos se recuperó y organizó mediante herramientas de descarga distribuida, que se almacenaron en sistemas de archivos de computación de alto desempeño (HPC), lo que indica un pipeline de datos sólido diseñado para alimentar a múltiples GPU de manera eficiente.

Una vez que el conjunto de datos se completó, el entrenamiento comenzó a utilizar una variedad de GPU de NVIDIA para desarrollar BioCLIP 2:

  • Entrenamiento amplio en NVIDIA A100: Como parte del programa piloto National IA Research Resource (NAIRR) de la National Science Foundation de los Estados Unidos, el equipo usó una asignación combinada en el Ohio Supercomputer Center y el Pittsburgh Supercomputer Center, ejecutando 64 GPU NVIDIA A100 durante 290 horas.
  • Entrenamiento de BioCLIP 2 en H100: La ejecución de entrenamiento principal para el modelo de BioCLIP 2 final se realizó en 32 GPU NVIDIA H100 a lo largo de 10 días.
  • Estudios de Ablación en H100: Para probar diferentes decisiones de modelado, se ejecutaron estudios de ablación en el conjunto de datos TreeOfLife-10M más pequeño mediante 8 GPU NVIDIA H100 durante 100 épocas.
  • Evaluación y Análisis en un Solo A100: Estos experimentos implicaron congelar los modelos entrenados y extraer vectores de características visuales para probar el desempeño en tareas como la clasificación de hábitats, la predicción de rasgos y la detección de enfermedades agrícolas.

 

"Las GPU de NVIDIA, conocidas por sus capacidades para acelerar la IA y la investigación científica, fueron parte esencial del proceso de hacer posibles estos descubrimientos al ofrecer el eje computacional necesario".

Tanya Berger-Wolf
Directora del Instituto de Análisis de Datos Traslacionales en la Universidad Estatal de Ohio

Descubrir Relaciones Ecológicas Inesperadas a Través de la IA

Los investigadores descubrieron un profundo potencial científico a través del entrenamiento y el desarrollo de BioCLIP 2. Los modelos fundacionales entrenados a escala muestran comportamientos emergentes notables, aprendiendo nuevas capacidades más allá de sus objetivos de entrenamiento iniciales.

Contrariamente a la expectativa de que las diferencias detalladas pudieran colapsar después de un entrenamiento extenso, BioCLIP 2 preservó las variaciones dentro de la especie. Esto permite al modelo diferenciar y alinear estas variantes. Por ejemplo, puede agrupar diferentes enfermedades de plantas en hojas dentro de la misma especie de planta y distinguir entre ejemplares juveniles y adultos o machos y hembras dentro de una sola especie animal.

La distribución de incrustación de diferentes especies se alineó espontáneamente con sus relaciones ecológicas sin entrenamiento explícito. Por ejemplo, el modelo capturó las variaciones en los tamaños de pico entre los pinzones de Darwin y distinguió entre las especies de peces de agua dulce y las especies de peces que no son de agua dulce.

Además, BioCLIP 2 (entrenado con las GPU de NVIDIA) superó a sus predecesores en numerosas categorías, entre ellas:

  • Mejora promedio del 18.0 % en la precisión de la clasificación de especies en comparación con BioCLIP
  • Mejora del desempeño promedio del 10.9 % en comparación con las sólidas líneas de base de lenguaje y visión y solo de visión en diversas tareas visuales biológicas
  • Mejora del 30.1 % sobre el modelo de CLIP original en la clasificación de especies
  • Brecha de desempeño del 22.8 % con respecto a BioCLIP en las imágenes de trampa de cámara, lo que demuestra una solidez mejorada
  • Mejora de más del 20 % zero-shot en las clasificaciones de conjuntos de datos de prueba de CameraTrap, Fungi y Rare Species

Las capacidades de BioCLIP 2 presentan oportunidades significativas para un mayor descubrimiento científico, la investigación de la biodiversidad y la toma de decisiones de conservación mediante la IA. El modelo permite workflows científicos más eficientes y automatizados, lo que abre nuevas vías para comprender las relaciones funcionales y ecológicas entre las especies.

Más información sobre cómo la computación acelerada de NVIDIA puede ayudar a lograr avances científicos a velocidades sin precedentes.

Historias de Clientes Relacionadas