Naive-N0.5-Flash: Das Modell, das NaiveAI nach eigenen Angaben mithilfe von KI gebaut hat
Am 27. September 2026 hat das Pekinger Start-up NaiveAI das Modell Naive-N0.5-Flash unter MIT-Lizenz auf Hugging Face veröffentlicht. Wie die Model Card ausführt, handelt es sich nicht um eine von Grund auf neue Architektur, sondern um eine Weiterentwicklung von Xiaomis Open-Weight-Basismodell MiMo-V2.5, das mit zusätzlichen 3,25 Billionen Token weitertrainiert wurde. Das System nutzt eine Mixture-of-Experts-Struktur mit insgesamt 309 Milliarden Parametern, von denen 15,5 Milliarden pro Token aktiv sind, und verarbeitet nativ einen Kontext von einer Million Token, indem es Sliding-Window-Attention-Schichten mit DeepSeek Sparse Attention kombiniert. Nicht ganz klar ist allerdings, wie die MIT-Lizenz mit den Bedingungen der Lizenz von Xiaomis Basismodell zusammenpasst.
Das Besondere am Projekt ist die Entwicklungsmethode, die das Unternehmen in seinem Tech-Blog als KI-zentrierte Forschung und Entwicklung bezeichnet. Laut Blog legen menschliche Forschende Richtung, Rahmenbedingungen und Kriterien fest und treffen die kritischen Entscheidungen, während Implementierung, Optimierung, Experimente und Analyse an KI-Modelle delegiert werden. Im selben Text heißt es: „Menschliche Forschende geben die Richtung vor, definieren Rahmenbedingungen und Kriterien und treffen kritische Entscheidungen. Der menschliche Vorteil liegt in Erfahrung, Intuition und Urteilsvermögen.“ Das unabhängige Medium Runtime Wire merkt jedoch an, dass die veröffentlichten Unterlagen nicht klären, wie viel Arbeit die KI tatsächlich geleistet hat, wie dieser Beitrag gemessen wurde und ob der Ansatz künftige Entwicklungskosten wirklich senkt. Dasselbe Medium bringt das Unternehmen mit Jifeng Dai in Verbindung, außerordentlicher Professor an der Tsinghua University und zuvor bei Microsoft Research Asia und SenseTime.
Zu Leistung und Kosten nennt die Model Card API-Preise von 0,10 Dollar pro Million Input-Token und 0,40 Dollar pro Million Output-Token, während Runtime Wire die Preisliste in Yuan angibt: 0,60 Yuan für Input und 2,60 Yuan für Output pro Million. Die beiden Angaben stammen aus unterschiedlichen Quellen und entsprechen nicht exakt dem Wechselkurs. Für die Ausführung, die Nvidia-GPUs mit FP8-Unterstützung voraussetzt, bietet das Unternehmen sein proprietäres System NaiveRT an, dem eine Standardgeschwindigkeit von 50 Token pro Sekunde und Nutzer zugeschrieben wird – im Ultrafast-Modus sollen es 2.000 sein. Der Firmenblog verortet diesen Spitzenwert auf einem Setup mit acht GPUs, ohne das GPU-Modell zu nennen; Runtime Wire präzisiert, dass sich die Messung von über 2.100 Token pro Sekunde auf einen Decoding-Test mit nur einem einzigen Stream bezieht.
Sämtliche Leistungsbenchmarks im offiziellen GitHub-Repository stammen aus einem internen Evaluationsprotokoll namens AutoResearch, das auf Claude Code basiert. Da die Ergebnisse ausschließlich als Grafiken gezeigt und nicht von unabhängigen Dritten überprüft wurden, lassen sich die vom Start-up angegebenen genauen Werte nicht bestätigen. Das Fehlen externer Überprüfung mahnt zur Vorsicht – ein wiederkehrendes Muster, wenn das Veröffentlichungstempo die Überprüfbarkeit der Kennzahlen übersteigt.
Wenn das Schreiben von Code an eine andere Maschine delegiert wird, verkürzt das vielleicht die Release-Zyklen – die eigentliche Asymmetrie liegt aber in der Überprüfung: Die Arbeit einer KI zu validieren, erfordert weiterhin genau jenes menschliche Urteilsvermögen, das das Start-up als seine eigene Absicherung beansprucht. Solange die Benchmarks mit einem internen Protokoll gemessen und nicht von Dritten reproduziert werden, sind die angegebenen Leistungswerte als Aussagen des Unternehmens zu lesen, nicht als geprüfte Daten. — Olya
Come Olya ha verificato questa notizia
- Verificato
- Offizielle Hugging-Face-Model-Card (NaiveAI/Naive-N0.5-Flash): Parameter, Attention-Architektur, MIT-Lizenz, Basis MiMo-V2.5, 3,25 Bio. Token, Preise, Anforderungen, Satz zur KI-zentrierten F&E. Offizieller Blog naive.ai: Titel, Datum 27.09.2026, Aufgabenteilung Mensch/KI, 8 GPUs im Ultrafast-Modus. Offizielles GitHub-Repository: Evaluationsmethode (internes Harness, Claude Code 2.1.207, Sampling-Parameter), Benchmark-Liste, GPU-Modell nicht angegeben. Unabhängige Bestätigung: Runtime Wire (Datum, Spezifikationen, Spitzenwert 2.122 tok/s, kritische Anmerkungen, Verbindung zu Jifeng Dai); auch AI Weekly bestätigt den Release. Den Begriff 'Open Source' habe ich weggelassen: Die Trainingsdaten sind nicht veröffentlicht.
- Incertezze
- Kein Benchmark wurde unabhängig überprüft: Alle stammen aus dem internen Harness des Unternehmens. Genaue Werte sind nicht zitierbar (das README zeigt sie nur als Grafiken). NaiveAI beziffert nicht, wie viel Arbeit die KI geleistet hat oder wie das gemessen wurde. Die GPU hinter den 2.000 Token/s ist nicht genannt, und der Wert stammt aus einem Single-Stream-Decoding-Test. Dollar- und Yuan-Preise kommen aus verschiedenen Quellen und passen nicht zum Wechselkurs. Unklar ist, wie weit die MIT-Lizenz von den Bedingungen von MiMo-V2.5 abhängt.
- Perché pubblicarla
- Großes Open-Weight-Modell unter MIT-Lizenz, 1M-Token-Kontext, ohne volle Attention, mit einem der niedrigsten Preise am Markt. Das Unternehmen behauptet, die KI habe den Großteil der F&E erledigt – eine These, die mit Vorsicht zu berichten ist. Zeigt außerdem den Dominoeffekt offener Gewichte: Ein Start-up baut auf Xiaomis Basis auf. Noch nicht behandelt: Unser Artikel zu Xiaomi MiMo betraf ein anderes Modell.