Educación superior / Investigación

StudyFetch reduce los costes de inferencia en ~10 veces con NVIDIA, ampliando el acceso al aprendizaje de IA para millones de estudiantes

Objetivo

StudyFetch está creando infraestructura de aprendizaje con tecnología de IA para más de 7 millones de estudiantes, educadores y estudiantes permanentes. Su plataforma convierte las conferencias en directo, las notas y los materiales de cursos en tutorías de IA personalizadas, planes de estudio, tarjetas didácticas, pruebas de práctica y un plan de estudios de creación de cursos basado en el trabajo real de cada alumno.

A medida que la demanda aumentó hasta alcanzar cientos de miles de conferencias cada mes, los techos de coste y precisión de la transcripción en la nube amenazaron la promesa básica de la empresa: mantener una IA capaz al alcance de las personas que más la necesitan. Al migrar su canalización de transcripción a NVIDIA Riva con el modelo Parakeet ASR, empaquetarla en microservicios de ${ NVIDIA NIM }™ y adoptar modelos abiertos de ${ NVIDIA Nemotron }™ con destilación en toda su pila, StudyFetch redujo los costes de su mayor carga de trabajo de inferencia en aproximadamente 10 veces, desbloqueando la tutoría de voz, la personalización en tiempo real y una nueva plataforma de aprendizaje agéntico diseñada para reducir las barreras a la IA para millones de estudiantes más y estudiantes permanentes. Esta asociación se está ampliando a la planificación de infraestructura dedicada, y StudyFetch explora tres sistemas NVIDIA B300 de 8 vías para apoyar un cambio de las cargas de trabajo de tutoría conversacional y generación de cursos de modelos cerrados a modelos abiertos, lo que proporciona al equipo una capacidad más predecible y menores costes de inferencia a medida que aumenta el uso.

Cliente

StudyFetch

Partner

AWS · Google Cloud

Caso de uso

IA generativa / LLMs, IA de voz,
inferencia,
IA de la fuerza de trabajo,
aprendizaje

Principales conclusiones

Eficiencia de inferencia

  • Reducción de costes de ~10 veces en la mayor carga de trabajo de inferencia al reemplazar la transcripción gestionada en la nube con NVIDIA Riva + Parakeet en contenedores de NVIDIA NIM

Aprendizaje personalizado

  • Cientos de miles de conferencias universitarias transcritas en tiempo real cada mes, y la misma capa de orquestación ahora escala el aprendizaje alineado con NVIDIA a los estudiantes permanentes y la fuerza de trabajo de próxima generación

Aprendizaje escalable

  • Más de 100 millones de interacciones de aprendizaje personalizadas en tiempo real a través del motor de aprendizaje de StudyFetch en las GPU NVIDIA H100 y L40S, con Honen lanzando programas de alfabetización en IA que llegan a 250 millones de estudiantes de primaria y secundaria
  • StudyFetch ahora está evaluando tres sistemas NVIDIA B300 de ocho vías para ampliar las cargas de trabajo de tutoría de modelos abiertos y generación de cursos con capacidad predecible y menores costes de inferencia

Mantener la tutoría de IA personal asequible para millones de estudiantes

StudyFetch es un espacio de trabajo de aprendizaje nativo de IA utilizado por más de 7 millones de estudiantes, principalmente de educación superior y programas de posgrado, que acuden a la plataforma para recibir tutorías de IA, practicar y estudiar materiales de IA basados en sus cursos reales. La transcripción de conferencias en directo constituye la base de la experiencia: es la forma en que la plataforma captura lo que se enseña a cada alumno y convierte esas aportaciones en un tutor de IA personal, tarjetas didácticas, pruebas de práctica y planes de estudio alineados con un plan de estudios real.

Esa base es también donde la empresa se enfrentó a sus restricciones más difíciles. Al ejecutar transcripciones en directo en el servicio gestionado de un importante proveedor de nube en cientos de miles de conferencias universitarias cada mes, StudyFetch se topó con dos obstáculos a la vez.

La primera fue el coste. La transcripción en directo ya era una partida mensual de seis cifras, y la rentabilidad unitaria empeoraba con cada nuevo alumno. Para una empresa cuya misión es hacer que una educación de calidad sea accesible para todos, cada dólar de coste de modelos se suma a unos márgenes que deben seguir siendo lo suficientemente bajos para que los estudiantes puedan permitirse el producto. La inferencia de modelos de frontera a escala de Internet simplemente no cuadra con la economía de la nube tradicional.

El segundo fue la precisión en los entornos en los que los estudiantes aprenden realmente. Las clases de universidades reales son ruidosas, están llenas de terminología específica del ámbito en materias como química orgánica, anatomía, estadística y programación, y a menudo son impartidas por profesores con una amplia gama de acentos y ritmos. La transcripción estándar no se ajustó a esa realidad, y la brecha de calidad se puso en evidencia en todas las superficies de productos que dependían de la transcripción: el tutor de IA, las tarjetas didácticas y las guías de estudio.

Toda la categoría de tecnología educativa está luchando contra la misma tensión. Los estudiantes necesitan una IA cada vez más capaz para seguir el ritmo de los cambios mundiales, pero servir modelos de frontera a escala no sale a cuenta bajo la economía de inferencia en la nube tradicional. StudyFetch necesitaba una pila de inferencia que pudiera ofrecer una IA capaz y precisa a un precio que sus estudiantes pudieran permitirse, sin sacrificar la precisión ni la flexibilidad de implementación.

Tractian

Impulsar la transcripción y la personalización en directo con NVIDIA Riva y Nemotron

A través del equipo de NVIDIA Inception, StudyFetch adaptó sus cargas de trabajo de inferencia de mayor coste a la IA de voz y la pila de modelos abiertos de NVIDIA. A medida que se profundizaba la asociación técnica, se ampliaba su alcance, desde la optimización de la infraestructura hasta la alineación de la plataforma en crecimiento de StudyFetch con la misión más amplia de NVIDIA de IA escalable y accesible en todas las instituciones, programas de capacitación laboral y comunidades de aprendizaje. En el núcleo de la nueva arquitectura:

  • NVIDIA Riva, un servicio de IA de voz acelerado por GPU que ejecuta el modelo de ASR Parakeet, produce transcripciones en directo y de alta precisión de las conferencias en tiempo real, incluidas las aulas ruidosas y el vocabulario técnico especializado que los servicios convencionales no lograban procesar.
  • Los microservicios de NVIDIA NIM (contenedores de inferencia predefinidos y optimizados para GPU) empaquetan e implementan la canalización de Riva en AWS y Google Cloud, lo que permite a un equipo pequeño ejecutar IA de voz en producción sin una función de MLOps dedicada.
  • NVIDIA Nemotron, una familia de modelos de lenguaje de gran tamaño abiertos, está integrada en la plataforma de API de StudyFetch junto con los principales modelos de frontera. Dado que Nemotron es abierto y ajustable con precisión, StudyFetch ejecuta canalizaciones de destilación servidas a través de NVIDIA NIM, comprimiendo modelos de mayor tamaño en implementables más pequeños y de menor latencia ajustados a las tareas específicas de la plataforma.
  • A medida que StudyFetch pasa a las cargas de trabajo de tutoría conversacional y generación de cursos, de modelos cerrados a modelos abiertos, el equipo está evaluando la infraestructura de NVIDIA B300 dedicada para apoyar la capacidad predecible, reducir los costes de inferencia y la evaluación continua de Nemotron a escala de producción.
  • El motor de aprendizaje de StudyFetch (su capa de contexto educativo) se ejecuta en las GPU NVIDIA H100 y L40S, enrutando las solicitudes de cada alumno a través de más de 100 millones de interacciones de aprendizaje y mejorando continuamente a medida que más estudiantes utilizan la plataforma.
  • Honen, la nueva plataforma de aprendizaje basado en agentes de StudyFetch, se basa en las GPU de NVIDIA desde el primer día y extiende el modelo de aprendizaje personalizado a la alfabetización en IA y la educación de la fuerza laboral. Los alumnos pueden lanzar cuadernos de Jupyter con tecnología de GPU dentro de cursos alineados por NVIDIA, lo que les proporciona experiencia práctica con los flujos de trabajo de IA. Se está integrando NVIDIA Training y el contenido de NVIDIA Deep Learning Institute, lo que ayuda a los estudiantes a familiarizarse con las herramientas de NVIDIA, la computación acelerada y los entornos de desarrollo de IA prácticos.

Reducción de los costes de inferencia en ~10 veces, al tiempo que se habilita la tutoría por voz y la personalización en tiempo real

La migración de la transcripción de conferencias en directo a NVIDIA Riva y Parakeet que se ejecutan en las GPU NVIDIA L40S en contenedores NVIDIA NIM permitió reducir aproximadamente 10 veces los costes en la mayor carga de trabajo de inferencia de la empresa. La destilación de Nemotron en las NVIDIA H100 está en camino de ofrecer reducciones sustanciales similares en el resto de la pila de inferencia. El impacto es visible dentro del propio producto. Mientras que el servicio anterior se retrasaba notablemente, los estudiantes ahora ven cómo se transcriben sus clases en tiempo real mientras habla el profesor. Cientos de miles de conferencias pasan por la canalización cada mes con una precisión que se corresponde con el audio de un aula real. El empaquetado de NVIDIA NIM significa que un equipo pequeño puede ejecutar todo esto sin necesidad de crear una función de MLOps independiente. El ahorro de costes permitió financiar capacidades que StudyFetch no podía justificar previamente con el mismo presupuesto:

  • Tutoría de IA multimodal y basada en voz: Las canalizaciones de texto a voz (TTS) de NVIDIA Riva para el tutor de IA están en desarrollo, con vistas a su lanzamiento en el verano antes del próximo año escolar, lo que permitirá el aprendizaje guiado por voz a los estudiantes que necesitan modalidades accesibles y conversacionales.
  • Personalización en tiempo real a escala: el motor de aprendizaje de las GPU NVIDIA H100 y L40S optimiza de forma continua más de 100 millones de interacciones de aprendizaje en toda la base de estudiantes.
  • Implementable en cualquier entorno: la pila NVIDIA Riva + NVIDIA NIM + Nemotron se ejecuta igual de bien en entornos de nube, de un solo inquilino y regulados, lo que abre Honen a clientes de empresas, gobiernos y educación.
  • Alfabetización en IA y alcance del ecosistema: las reducciones de costes permiten a StudyFetch ofrecer nuevas capacidades a los estudiantes, lo que reduce las barreras a la IA para estudiantes, profesionales en activo y grupos de reciclaje profesional.

El ahorro de costes se traduce directamente en una mayor capacidad en manos de más estudiantes y justificó algo más grande que la transcripción.

StudyFetch existe para hacer que una educación de calidad sea accesible para cualquier persona. NVIDIA es lo que hace que eso sea económicamente posible. La asociación con su equipo en Riva, Nemotron y el resto de la pila hizo más que reducir nuestros costes: nos permitió poner más capacidad en manos de más estudiantes, para que puedan aprender las cosas que necesitan aprender a un precio que pueden permitirse».

Ryan Trattner
, cofundador y CTO de StudyFetch

Escalar la educación personal a la fuerza de trabajo y la próxima generación

Con la transcripción, la personalización y Honen ejecutándose sobre una base compartida de NVIDIA, StudyFetch está ampliando la asociación en varios frentes:

  • NVIDIA Riva TTS se implementará en las canalizaciones de voz de los tutores de IA este verano, antes del próximo año escolar, y la destilación de Nemotron se está acercando a su pico de despliegue en toda la pila de inferencia más amplia a medida que la empresa acumula más datos de uso específicos del plan de estudios.
  • StudyFetch está evaluando tres sistemas NVIDIA B300 de 8 vías para apoyar su transición de las dependencias de modelos cerrados a la tutoría conversacional y la generación de cursos, y se espera que las evaluaciones de Nemotron sirvan de base para futuras decisiones de implementación.
  • Honen se lanza con NVIDIA y llega a 250 000 estudiantes de primaria y secundaria a través de programas de alfabetización en IA que se imparten junto con NVIDIA Training y contenido de NVIDIA deep learning Institute, con planes de despliegue más amplios en educación superior y el sector laboral.
  • StudyFetch está explorando implementaciones de Honen en instalaciones locales y de un solo inquilino para sectores regulados y clientes de educación gubernamental, utilizando modelos destilados de Nemotron ajustados para esos entornos.
  • El equipo está evaluando modelos de visión acelerados por NVIDIA para capacitar a estudiantes de enfermería y técnicos de profesiones afines a la salud en imágenes médicas, ampliando el alcance de la plataforma a la educación clínica y de profesiones afines a la salud.

La asociación de StudyFetch y NVIDIA muestra cómo una victoria en la infraestructura de IA de producción puede convertirse en un modelo para un acceso más amplio. Al reducir los costes de inferencia, mejorar las experiencias de aprendizaje en tiempo real y conectar a los estudiantes con herramientas y contenido alineado con NVIDIA, StudyFetch está ayudando a que la alfabetización en IA y el aprendizaje de la fuerza laboral sean escalables en las aulas, los campus, las comunidades y la fuerza laboral en general.  

Historias de clientes relacionadas