Hochschulen und Forschung

StudyFetch senkt die Inferenzkosten mit NVIDIA um das ca. 10-Fache und erweitert den Zugang zu KI-Lernen für Millionen von Lernenden

Ziel

StudyFetch entwickelt KI-gestützte Lerninfrastruktur für mehr als 7 Millionen Studierende, Lehrende und lebenslang Lernende. Die Plattform verwandelt Live-Vorlesungen, Notizen und Kursmaterialien in personalisiertes KI-Tutoring, Lernpläne, Flashcards, Praxistests und Lehrpläne für die Kursentwicklung, die auf der realen Kursarbeit jedes Lernenden basieren.

Als die Nachfrage auf Hunderttausende von Vorlesungen pro Monat stieg, bedrohten die Kosten- und Genauigkeitsgrenzen für standardmäßige Cloud-Transkription das zentrale Versprechen des Unternehmens: leistungsfähige KI für die Menschen erschwinglich zu halten, die sie am meisten benötigen. Durch die Migration seiner Transkriptionspipeline auf NVIDIA Riva mit dem Parakeet ASR-Modell, die Integration in NVIDIA NIM™-Microservices und die Übernahme offener NVIDIA Nemotron™-Modelle mit Destillation im gesamten Stack hat StudyFetch die Kosten seines größten Inferenz-Workloads um etwa das Zehnfache gesenkt – durch die Bereitstellung von Sprach-Tutoring, Echtzeit-Personalisierung und einer neuen Plattform für agentisches Lernen, die entwickelt wurde, um KI-Barrieren für Millionen weiterer Studierender und lebenslang Lernender zu senken. Diese Partnerschaft wird jetzt auf die dedizierte Infrastrukturplanung ausgeweitet, wobei StudyFetch drei 8-Way-NVIDIA-B300-Systeme untersucht, um eine Verlagerung von dialogbasiertem Tutoring und Kursgenerierungs-Workloads von geschlossenen auf offene Modelle zu unterstützen, was dem Team vorhersehbarere Kapazitäten und geringere Inferenzkosten bietet, wenn die Nutzung wächst.

Kunde

StudyFetch

Partner

AWS · Google Cloud

Anwendungsbeispiel

Generative KI / LLMs Sprach-KI,
Inferenz,
Workforce-KI,
Lernen

Das Wichtigste im Überblick

Inferenzeffizienz

  • Ca. 10-fache Kostensenkung beim größten Inferenz-Workload durch Ersetzen der verwalteten Cloud-Transkription durch NVIDIA Riva + Parakeet in NVIDIA NIM-Containern

Personalisiertes Lernen

  • Hunderttausende von College-Vorlesungen, die jeden Monat in Echtzeit transkribiert werden, wobei dieselbe Orchestrierungsebene jetzt NVIDIA-konformes Lernen auf lebenslang Lernende und die Erwerbsbevölkerung der nächsten Generation skaliert

Skalierbares Lernen

  • Mehr als 100 Millionen Lerninteraktionen, die in Echtzeit über die Learn Engine von StudyFetch auf NVIDIA H100- und L40S-GPUs personalisiert werden, wobei Honen KI-Kompetenzprogramme startet, die 250.000 Schüler im Primar- und Sekundarbereich erreichen
  • StudyFetch bewertet jetzt drei 8-Way-NVIDIA-B300-Systeme, um Tutoring-Workloads für offene Modelle und die Kursgenerierung mit vorhersehbarer Kapazität und geringeren Inferenzkosten zu erweitern

Persönliches KI-Tutoring für Millionen von Lernenden erschwinglich halten

StudyFetch ist ein KI-nativer Lern-Workspace, der von mehr als 7 Millionen Lernenden genutzt wird – hauptsächlich an Hochschulen und in postgradualen Studiengängen –, die auf die Plattform kommen, um KI-Tutoring, Übungen und Lernmaterialien zu nutzen, die auf ihrer tatsächlichen Kursarbeit basieren. Die Live-Vorlesungstranskription bildet die Grundlage dieses Erlebnisses: Auf diese Weise erfasst die Plattform, was jedem Lernenden beigebracht wird, und verwandelt diese Eingaben in einen persönlichen KI-Tutor, Flashcards, Übungstests und Studienpläne, die an einem realen Lehrplan ausgerichtet sind.

Auf dieser Grundlage stieß das Unternehmen außerdem an seine stärksten Einschränkungen. Durch die Ausführung der Live-Transkription auf dem Managed-Service eines großen Cloud-Anbieters bei Hunderttausenden von College-Vorlesungen jeden Monat stieß StudyFetch auf zwei Hindernisse gleichzeitig.

Das erste waren die Kosten. Die Live-Transkription war bereits ein monatlicher sechsstelliger Posten, und die Unit Economics verschlechterten sich mit jedem neuen Lernenden. Für ein Unternehmen, dessen Mission es ist, großartige Bildung für jeden zugänglich zu machen, wirkt sich jeder Dollar an Modellkosten auf die Margen aus, die niedrig genug bleiben müssen, damit sich Lernende das Produkt leisten können. Inferenz mit Frontier-Modellen im Internet-Maßstab ist mit herkömmlicher Cloud-Ökonomie einfach nicht tragbar.

Das zweite Hindernis war die Genauigkeit in den Umgebungen, in denen Lernende tatsächlich lernen. Echte College-Vorlesungen sind laut – voller fachspezifischer Terminologie in Fächern wie organischer Chemie, Anatomie, Statistik und Programmierung – und werden häufig von Professoren mit einer Vielzahl von Akzenten und unterschiedlichem Sprechtempo gehalten. Die Standard-Transkription war nicht auf diese Realität abgestimmt, und die Qualitätslücke zeigte sich nachgelagert in jedem Produktbereich, der auf dem Transkript basierte: dem KI-Tutor, den Flashcards und den Studienleitfäden.

Die gesamte Edtech-Kategorie kämpft mit den gleichen Hürden. Lernende benötigen zunehmend leistungsfähige KI, um mit dem Tempo Schritt zu halten, in dem sich die Welt verändert, aber die Bereitstellung von Frontier-Modellen in großem Maßstab ist unter herkömmlicher Cloud-Inferenz-Ökonomie finanziell nicht tragbar. StudyFetch benötigte einen Inferenz-Stack, der leistungsfähige, genaue KI zu einem Preis bieten konnte, den sich Lernende leisten konnten – ohne Kompromisse bei der Genauigkeit oder der Bereitstellungsflexibilität.

Tractian

Unterstützung von Live-Transkription und Personalisierung mit NVIDIA Riva und Nemotron

Über das NVIDIA Inception-Team hat StudyFetch seine kostenintensivsten Inferenz-Workloads mit der Sprach-KI und dem Open-Model-Stack von NVIDIA verknüpft. Im Zuge der Vertiefung der technischen Partnerschaft wurde ihr Umfang erweitert – von der Infrastrukturoptimierung bis hin zur Ausrichtung der wachsenden Plattform von StudyFetch auf die breitere Mission von NVIDIA für skalierbare, zugängliche KI in Institutionen, Mitarbeiterprogrammen und Lerngemeinschaften. Im Kern der neuen Architektur:

  • NVIDIA Riva, ein GPU-beschleunigter Sprach-KI-Dienst, der das Parakeet ASR-Modell ausführt, produziert hochpräzise Live-Transkripte von Vorlesungen in Echtzeit – einschließlich der lauten Klassenzimmer und des stark domänenspezifischen Vokabulars, an denen Standard-Dienste scheiterten.
  • NVIDIA NIM-Microservices – vorgefertigte, GPU-optimierte Inferenz-Container – verpacken und stellen die Riva-Pipeline sowohl in AWS als auch in Google Cloud bereit, sodass ein kleines Team Sprach-KI in der Produktion ohne eine dedizierte MLOps-Funktion ausführen kann.
  • NVIDIA Nemotron, eine Familie offener großer Sprachmodelle, ist neben führenden Frontier-Modellen in die API-Plattform von StudyFetch integriert. Da Nemotron offen und feinabgestimmbar ist, führt StudyFetch Destillationspipelines aus, die über NVIDIA NIM bereitgestellt werden, wodurch größere Modelle in kleinere, latenzärmere bereitstellbare Einheiten komprimiert werden, die auf die spezifischen Aufgaben der Plattform abgestimmt sind.
  • Da StudyFetch mehr dialogbasiertes Tutoring und Kursgenerierungs-Workloads von geschlossenen Modellen auf offene Modelle verlagert, bewertet das Team eine dedizierte NVIDIA B300-Infrastruktur, um vorhersehbare Kapazität, niedrigere Inferenzkosten und die fortgesetzte Nemotron-Bewertung im Produktionsmaßstab zu unterstützen.
  • Die Learn Engine von StudyFetch – seine Bildungskontextebene – läuft auf NVIDIA H100- und L40S-GPUs und leitet die Anfragen jedes Lernenden über mehr als 100 Millionen Lerninteraktionen weiter und wird kontinuierlich verbessert, je mehr Lernende die Plattform nutzen.
  • Honen, die neue agentische Lernplattform von StudyFetch, basierte vom ersten Tag an auf NVIDIA-GPUs und erweitert das personalisierte Lernmodell um KI-Kompetenz und die Mitarbeiterfortbildung. Lernende können GPU-gestützte Jupyter-Notebooks in mit NVIDIA abgestimmten Kursen starten, um praktische Erfahrungen mit KI-Workflows zu erhalten. Inhalte von NVIDIA Training und dem NVIDIA Deep Learning Institute werden integriert, um Lernenden dabei zu helfen, sich mit NVIDIA-Tools, beschleunigtem Computing und praktischen KI-Entwicklungsumgebungen vertraut zu machen.

Senkung der Inferenzkosten um etwa das Zehnfache bei gleichzeitiger Erschließung von Sprach-Tutoring und Echtzeit-Personalisierung

Die Migration der Live-Vorlesungstranskription auf NVIDIA Riva und Parakeet, die auf NVIDIA L40S-GPUs in NVIDIA NIM-Containern ausgeführt werden, führte zu einer etwa zehnfachen Kostensenkung beim größten Inferenz-Workload des Unternehmens. Die Nemotron-Destillation auf NVIDIA H100s ist auf Kurs, um ähnliche erhebliche Reduzierungen im Rest des Inferenz-Stacks zu ermöglichen. Die Wirkung ist im Produkt selbst zu sehen. Während der vorherige Service merklich verzögert war, sehen die Lernenden jetzt zu, wie ihre Vorlesungen in Echtzeit transkribiert werden, während der Professor spricht. Hunderttausende von Vorlesungen werden jeden Monat durch die Pipeline mit einer Genauigkeit abgewickelt, die realen Audiodaten im Klassenzimmer entspricht. NVIDIA NIM-Packaging bedeutet, dass ein kleines Team all dies ausführen kann, ohne eine separate MLOps-Funktion einzurichten. Die Kosteneinsparungen ermöglichten Kapazitäten, die StudyFetch zuvor mit demselben Budget nicht rechtfertigen konnte:

  • Multimodales, sprachbasiertes KI-Tutoring: NVIDIA Riva Text-to-Speech (TTS)-Pipelines für den KI-Tutor befinden sich in der Entwicklung und sind für die Sommereinführung vor dem nächsten Schuljahr vorgesehen – so wird sprachgesteuertes Lernen für Lernende erschlossen, die zugängliche Gesprächsmodalitäten benötigen.
  • Echtzeit-Personalisierung in großem Maßstab: Die Learn Engine auf NVIDIA H100- und L40S-GPUs optimiert kontinuierlich mehr als 100 Millionen Lerninteraktionen in der gesamten Nutzerbasis.
  • Bereitstellbar in jeder Umgebung: Der NVIDIA Riva + NVIDIA NIM + Nemotron-Stack läuft gleichermaßen gut in Cloud-, Single-Tenant- und regulierten Umgebungen und erschließt Honen für Unternehmen, Behörden und Kunden im Bildungswesen.
  • Breitere KI-Kompetenz und Reichweite des Ökosystems: Kostensenkungen ermöglichen es StudyFetch, neue lernorientierte Funktionen bereitzustellen, wodurch die Barrieren für den Einstieg in KI für Studierende, Berufstätige und Umschulungskohorten gesenkt werden.

Die Kosteneinsparungen führen direkt zu mehr Möglichkeiten in den Händen von mehr Lernenden – und haben den Ausschlag für etwas Größeres als die Transkription gegeben.

„StudyFetch existiert, um großartige Bildung für jeden zugänglich zu machen. NVIDIA macht das wirtschaftlich möglich. Die Partnerschaft mit dem Team von NVIDIA bei Riva, Nemotron und dem Rest des Stacks hat unsere Kosten erheblich gesenkt – dadurch konnten wir mehr Studierenden mehr Möglichkeiten bieten, die Dinge zu lernen, die sie lernen müssen, und zu einem Preis, den sie sich leisten können.“

Ryan Trattner
, Mitbegründer und CTO, StudyFetch

Ausweitung der persönlichen Weiterbildung auf die Erwerbsbevölkerung und die nächste Generation

Da Transkription, Personalisierung und Honen auf einer gemeinsamen NVIDIA-Basis ausgeführt werden, erweitert StudyFetch die Partnerschaft an mehreren Fronten:

  • NVIDIA Riva TTS wird in diesem Sommer, vor dem nächsten Schuljahr, für die AI-Tutor-Sprachpipelines eingeführt, und die Nemotron-Destillation nähert sich dem maximalen Rollout im breiteren Inferenz-Stack, da das Unternehmen mehr lehrplanspezifische Nutzungsdaten sammelt.
  • StudyFetch bewertet drei 8-Way-NVIDIA-B300-Systeme, um den Übergang von Abhängigkeiten von geschlossenen Modellen zu dialogbasiertem Tutoring und Kurserstellung mit offenen Modellen zu unterstützen, wobei Nemotron-Bewertungen voraussichtlich zukünftige Bereitstellungsentscheidungen beeinflussen werden.
  • Honen startet mit NVIDIA und erreicht 250.000 Schüler und Schülerinnen im Primar- und Sekundarbereich durch KI-Kompetenzprogramme, die zusammen mit Inhalten von NVIDIA Training und NVIDIA Deep Learning Institute bereitgestellt werden, wobei ein verstärkter Einsatz in Hochschulen und bei der Erwerbsbevölkerung geplant ist.
  • StudyFetch erkundet On-Premises- und Single-Tenant-Bereitstellungen von Honen für regulierte Branchen und Kunden aus dem staatlichen Bildungswesen mit destillierten Nemotron-Modellen, die auf diese Umgebungen abgestimmt sind.
  • Das Team bewertet NVIDIA-beschleunigte Vision-Modelle, um Pflegestudenten und medizinisch-technische Fachkräfte in medizinischer Bildgebung zu trainieren und so die Reichweite der Plattform in die klinische Ausbildung und die Ausbildung in Gesundheitsfachberufen zu erweitern.

Die Partnerschaft von StudyFetch und NVIDIA zeigt, wie ein Erfolg bei der Produktions-KI-Infrastruktur zu einem Modell für einen breiteren Zugang werden kann. Durch die Senkung der Inferenzkosten, die Verbesserung der Lernerfahrungen in Echtzeit und die Verbindung von Lernenden mit NVIDIA-konformen Tools und Inhalten trägt StudyFetch dazu bei, KI-Kompetenz und Mitarbeiterfortbildung in Klassenzimmern, Universitäten, Gemeinden und der gesamten Erwerbsbevölkerung skalierbar zu machen.

Ähnliche Erfolgsgeschichten