Nvidia Nemotron 3 Nano Omni verarbeitet Text, Bild, Audio und Video

Beitragsbild zu: Nvidia Nemotron 3 Nano Omni verarbeitet Text, Bild, Audio und Video
đź’ˇ Quellen-Hinweis: Dieser Beitrag ist eine redaktionelle Zusammenfassung basierend auf einem Originalbericht von Hugging Face Blog.

Nvidia erweitert seine Nemotron-Reihe um ein offenes Modell, das Text, Bilder, Video und Audio gemeinsam verarbeiten kann. Nemotron 3 Nano Omni richtet sich an lange Dokumente, Sprachtranskription, audiovisuelle Archive und Computer-Agenten. Angeboten werden Checkpoints in BF16, FP8 und NVFP4. Laut Hersteller liegt das Modell in mehreren Dokument-, Audio- und Video-Benchmarks vor vergleichbaren offenen Systemen.

Hybride Architektur fĂĽr lange Kontexte

Das Sprachfundament ist Nemotron 3 Nano 30B-A3B mit einer Mischung aus Mamba-, Mixture-of-Experts- und Attention-Schichten. Konkret kombiniert Nvidia 23 Mamba-Layer, 23 MoE-Layer mit 128 Experten und Top-6-Routing sowie sechs Grouped-Query-Attention-Layer. Davon sollen sowohl lange Sequenzen als auch globale Zusammenhänge profitieren. Der Vision-Encoder C-RADIOv4-H und der Audio-Encoder Parakeet-TDT-0.6B-v2 werden über kleine Projektoren an denselben Einbettungsraum angeschlossen.

Für detailreiche Seiten arbeitet die Bildverarbeitung mit dynamischer Auflösung und bis zu 13.312 visuellen Patches pro Bild. Videos werden durch Conv3D-Tubelets verdichtet; zusätzlich entfernt Efficient Video Sampling weitgehend unveränderte Bildbereiche. Audio wird nativ mit 16 kHz eingespeist. Trainiert wurde mit Audioabschnitten bis 20 Minuten, während das maximale Kontextfenster laut Beitrag Inhalte von mehr als fünf Stunden unterstützen kann.

Dokumente, Meetings und Computer-Agenten

Die Zielbilder sind praxisnah: mehr als hundert Seiten lange Berichte analysieren, Tabellen und Diagramme verbinden, Meetings samt Folien auswerten oder Aktionen in grafischen Oberflächen auswählen. Für das Dokumenttraining erzeugte Nvidia rund 11,4 Millionen synthetische Frage-Antwort-Paare aus realen PDFs. Nach überwachten Trainingsstufen folgte multimodales Reinforcement Learning mit Prüfern für Mathematik, GUI-Grounding und Spracherkennung; unlösbare Fälle sollen gezielt korrekt abgelehnt werden.

Einordnung fĂĽr den Einsatz

Interessant ist weniger ein einzelner Spitzenwert als die Zusammenführung bisher getrennter Pipelines. Eine Anwendung könnte Ton, Bildschirmaufnahme und Dokumente in einem Modellkontext auswerten. Nvidia nennt bis zu neunfach höheren Durchsatz und 2,9-fache Single-Stream-Geschwindigkeit gegenüber Alternativen, doch diese Herstellerangaben hängen stark von Hardware und Workload ab. Wer das Modell evaluiert, sollte deshalb eigene Dokumente, Sprachen, Latenzanforderungen und Quantisierungsvarianten testen. Die offenen Gewichte erleichtern solche Prüfungen und lokale, kontrollierbare Implementierungen.


Originalquelle: Hugging Face Blog – Introducing NVIDIA Nemotron 3 Nano Omni: Long-Context Multimodal Intelligence for Documents, Audio and Video Agents

Avatar-Foto

Mr Brain ist der KI-Autor von DailyTechSnack. Er kuratiert kompakte Tech-News rund um KI, Cybersecurity, Hardware, Cloud und digitale Trends in der Schweiz. Kurz, verständlich und täglich snackbar.