Ein Kolibri aus Heidelberg: Deutschland trainiert wieder ein eigenes KI-Modell
Am Tag der Deutschen Einheit hat Aleph Alpha Kolibri veröffentlicht: offen, auf Deutsch spezialisiert und klein genug für den eigenen Server. Es ist nicht das stärkste Modell der Welt. Warum es trotzdem eine gute Nachricht ist und wo seine Grenzen liegen.

In einem Satz
Aleph Alpha hat am 3. Oktober 2026 Kolibri veröffentlicht, ein offenes Sprachmodell, das von Grund auf in Deutschland und Finnland trainiert wurde; es ist nicht das stärkste Modell der Welt, liegt in seiner Gewichtsklasse aber laut eigener Messung vorn, versteht Deutsch ungewöhnlich gut und läuft auf einem einzigen Server, und genau diese Mischung macht es für Verwaltung und Industrie interessant.
Am 3. Oktober 2026, dem Tag der Deutschen Einheit, schaltet eine Firma aus Heidelberg auf Hugging Face ein Paket von 78 Gigabyte frei. Der Name: Kolibri. Die Lizenz: Apache 2.0, also frei für alle, auch für kommerzielle Zwecke. Das Datum ist kein Zufall. Aleph Alpha eröffnet die Ankündigung sogar mit dem Feiertag.
Darüber habe ich mich ehrlich gefreut. Danach habe ich getan, was man bei jeder Ankündigung tun sollte: die Modellkarte gelesen, den technischen Bericht mit seinen 189 Seiten durchgearbeitet und nachgesehen, wo man das Modell heute überhaupt nutzen kann. Am Ende stand eine Frage, die mich seitdem beschäftigt. Ist ein deutsches Modell, das nicht das stärkste der Welt ist, trotzdem ein Grund zur Freude?
Die Firma, die schon aufgegeben schien
Warum Kolibri überrascht, verstehst du erst, wenn du ein paar Jahre zurückgehst. 2019 gründen Jonas Andrulis und Samuel Weinbach in Heidelberg Aleph Alpha. 2023 sammelt die Firma in einer Runde, die unter anderen die Schwarz Gruppe (Lidl, Kaufland) und Bosch anführen, nach eigener Darstellung rund 500 Millionen Dollar ein. In der Presse heißt sie damals gern das europäische OpenAI.
Dann kippt die Geschichte. Im Herbst 2024 stellt Aleph Alpha die Arbeit an großen eigenen Sprachmodellen zurück und baut stattdessen PhariaAI, eine Plattform, auf der Unternehmen Modelle betreiben und anpassen. Andrulis begründet den Schritt damals sinngemäß so: Ein europäisches Sprachmodell allein sei kein Geschäftsmodell.
Was folgt, sieht nicht nach Comeback aus: Im Oktober 2025 gibt Andrulis den Chefposten ab, im April 2026 kündigen Aleph Alpha und das kanadische KI-Unternehmen Cohere an, sich zusammenzuschließen, und im September unterschreiben beide den Vertrag. Ende September verlässt auch der Co-Chef Reto Spörri die Firma.
Genau in diese Lage fällt Kolibri. Und es ist kein nachtrainiertes fremdes Modell, wie es inzwischen viele gibt. In der Modellkarte steht unter den Abhängigkeiten: keine, von Grund auf trainiert. Eigene Daten. Ein eigener Tokenizer. Eine eigene Trainingskette, die von den Rohdaten bis zum fertigen Reasoning-Modell alles abdeckt und in der sich jeder Trainingslauf über einen einzigen Stand im Code wiederholen lässt. Das ist der Teil, über den ich mich wirklich freue.
78 Milliarden Parameter, von denen fast alle schlafen
Auf dem Papier hat Kolibri 78 Milliarden Parameter. Für jedes einzelne Token rechnen davon aber nur 3,46 Milliarden. Das sind 4,4 Prozent.
Der Trick dahinter heißt Mixture of Experts. Stell dir eine Klinik vor, in der auf jeder Etage 384 Fachärztinnen und Fachärzte sitzen. Wer hereinkommt, wird nicht von allen untersucht, sondern von den sechs, die zum Fall passen, plus einer Allgemeinärztin, die jeden sieht. Alle anderen bleiben in ihren Zimmern. Das Haus hat das Wissen aller, bezahlt wird nur für sieben. Kolibri hat 50 solcher Etagen.
Diese Bauweise ist eine bewusste Rechnung, und Aleph Alpha legt sie offen. Im Versuch lief auch eine größere Variante mit 123 Milliarden Parametern, und die war besser. Auf zwei H100-Grafikkarten schaffte sie aber nur drei gleichzeitige Anfragen mit langen Dokumenten von 256.000 Token. Kolibri bedient auf derselben Hardware 18 solcher Anfragen und schreibt dabei 28 Prozent schneller. Für eine Behörde, die ein Modell im eigenen Rechenzentrum betreibt, entscheidet so eine Zahl darüber, ob am Ende zehn Leute damit arbeiten oder tausend.
Dafür bezahlt Kolibri mit Speicher. Alle 78 Milliarden Parameter müssen im Grafikspeicher liegen, auch die, die gerade schlafen. In der kompakten Fassung mit acht Bit je Zahl sind das rund 78 Gigabyte. Laut Modellkarte genügt dafür eine einzige H200- oder B200-Karte oder ein Paar älterer A100 mit je 80 Gigabyte. Ein Spielzeug ist das nicht. Aber es ist ein Server, den sich ein mittelgroßes Rechenzentrum in den Keller stellen kann.
Wie gut diese Rechnung aufgeht, siehst du erst, wenn du Kolibri neben Modelle stellst, die pro Token ähnlich viel oder mehr rechnen.
Gesamtwert: Durchschnitt aller deutschen Tests in Aleph Alphas eigener Messung, alle Modelle mit der höchsten Denkstufe. Die Achse der aktiven Parameter ist gestaucht, damit die dicht beieinanderliegenden Modelle lesbar bleiben. Quelle: Modellkarte Kolibri-1, Stand 3. Oktober 2026; aktive Parameter von GPT-OSS laut Modellkarte von OpenAI.
Die Grafik zeigt beides: was mich überzeugt und was nicht. Unter den Modellen, die pro Token drei bis sechs Milliarden Parameter bewegen, liegt Kolibri in Aleph Alphas Messung vorn, knapp vor GPT-OSS 120B von OpenAI. Nemotron 3 Super von Nvidia rechnet mit dreieinhalbmal so vielen aktiven Parametern und landet trotzdem darunter.
Nur steht ganz oben rechts Qwen3.8 27B von Alibaba. Das ist ein klassisches dichtes Modell, bei dem jedes Token alle 27 Milliarden Parameter durchläuft. Es ist deutlich besser. Es kostet pro Token aber auch fast achtmal so viel Rechenarbeit.
Ein Modell, das auf Deutsch denkt
Der zweite Grund für meine Freude ist die Sprache. Die meisten großen Modelle haben Deutsch nebenbei gelernt, aus dem Anteil, der im englischsprachigen Netz eben mit abfällt. Kolibri ist von Anfang an zweisprachig gebaut. 21,3 Prozent der Trainingsdaten sind Deutsch, rund 4,3 Billionen Token.
So viel Deutsch gab es nicht fertig zu kaufen. Aus allen offenen deutschen Datensätzen blieben nach dem Aussortieren nur 390 Milliarden Token übrig, weniger als ein Zehntel des Ziels. Also hat das Team selbst im Common Crawl gesucht, einer frei verfügbaren Kopie großer Teile des Webs. Dabei ist ihm etwas aufgefallen, das ich wunderbar finde. Übliche Filter werfen Texte mit vielen langen Wörtern hinaus, weil das im Englischen auf Datenmüll hindeutet. Im Deutschen trifft genau dieser Filter die Sprache, in der Behörden schreiben. Erst mit angepassten Regeln blieb das Verwaltungsdeutsch im Datensatz.
Dabei hat Aleph Alpha nur sparsam übersetzt, rund sechs Prozent der Daten. Die Begründung ist schön konkret. Aus "Drive safe!" wird maschinell "Fahre sicher!" statt "Komm gut an!". Und ein übersetztes Netz spricht Deutsch über eine Welt, die amerikanisch aussieht: mit einem Präsidenten statt einem Kanzler.
Das geht bis ins Nachdenken. Kolibri ist darauf trainiert, auch im Denkprozess Deutsch zu schreiben, damit Nutzerinnen und Nutzer nachvollziehen können, wie es zu einer Antwort kommt. Für eine Prüferin in einer Behörde ist das mehr als Komfort, denn wer eine Entscheidung verantworten muss, will wissen, auf welchem Weg der Vorschlag zustande gekommen ist. Sie kann den Gedankengang lesen, statt einem englischen Protokoll zu vertrauen.
Wie groß der Unterschied ist, zeigt der Tokenizer, das Werkzeug, das Text in Bausteine zerlegt. Wenn du den Beitrag über Token hier im Wissen-Bereich kennst, weißt du, warum Deutsch bei den meisten Modellen teurer ist: Lange Zusammensetzungen zerfallen in viele kleine Stücke. Kolibris Tokenizer schneidet dagegen entlang der Wortbestandteile.
Oben: Zerlegungen aus Aleph Alphas Ankündigung; Qwen3.8 und Gemini schneiden diese Wörter ähnlich klein wie GPT-5. Unten: gemessen auf deutschem Webtext (FineWeb-2), ein Byte entspricht etwa einem Buchstaben, Umlaute zählen doppelt. Quelle: Aleph Alpha, 3. Oktober 2026.
Das klingt nach Kosmetik, ist aber Geld. Ich habe die Werte aus der Grafik nachgerechnet: Für denselben deutschen Text braucht GPT-5 rund 13 Prozent mehr Token als Kolibri, DeepSeek V4 rund 32 Prozent mehr. Weil jedes Token Rechenzeit kostet und Anbieter pro Token abrechnen, schlägt das direkt auf Rechnung und Antwortzeit durch.
Der Satz, den die meisten Modelle nie lernen
Und dann ist da ein Satz, der in Behörden und Unternehmen mehr wert ist als jede Bestnote in Mathematik: Ich weiß es nicht.
Sprachmodelle raten gern. Das ist kein Charakterfehler, das ist Training. Ein geratener Treffer bringt im Test Punkte, ein ehrliches Passen bringt keine. Also lernen Modelle, lieber irgendetwas zu sagen. Für eine Sachbearbeiterin, die mit einem Modell Bescheide vorbereitet, ist genau das die gefährlichste Eigenschaft.
Aleph Alpha trainiert dagegen mit einem Spiel, das klingt wie aus der Artussage. Arthur ist das Modell, das am Ende ausgeliefert wird. Merlin bekommt ein Dokument und formt es so um, dass Arthur die Frage leichter richtig beantworten kann. Morgana nimmt dasselbe Dokument und schneidet heimlich genau die Stelle heraus, auf die es ankommt. Arthur weiß nie, wer ihm das Dokument gereicht hat.
Vereinfachte Darstellung des Trainingsverfahrens, das Aleph Alpha Merlin-Arthur-Protokoll nennt. Die Gegenspielerin Morgana erzeugt dabei automatisch die Beispiele, in denen Passen die einzige richtige Antwort ist. Quelle: Aleph Alpha, Ankündigung vom 3. Oktober 2026.
Der Kniff liegt in der Unsicherheit. Weil Arthur nicht weiß, ob Merlin oder Morgana am Werk war, bleibt ihm nur eine Strategie, die immer funktioniert: genau lesen und nur dann antworten, wenn das Dokument die Antwort wirklich trägt.
Das Ergebnis lässt sich messen, und hier wird es gemischt. Im Test AA-Omniscience, der auch Fragen stellt, die ein Modell nicht sicher wissen kann, vermeidet Kolibri bei 44 Prozent der Fragen eine falsche Antwort. Der interne Vorgänger kam auf 15 Prozent. Das ist ein großer Sprung. Qwen3.6 schafft in derselben Messung allerdings 56,7 Prozent und Qwen3.8 27B sogar 67,3. Fortschritt ja, Bestwert nein.
Wie stark ist Kolibri wirklich?
Damit sind wir bei der Frage, die alle zuerst stellen. Die ehrliche Antwort hat zwei Teile.
Erstens stammen bisher alle Zahlen von Aleph Alpha selbst, gemessen mit eigenen Werkzeugen, in einer Auswahl von Tests, die der Hersteller zusammengestellt hat, und mit der höchsten Denkstufe für jedes Modell. Das ist bei neuen Modellen üblich und kein Vorwurf. Unabhängige Ranglisten wie Artificial Analysis führten Kolibri am 4. Oktober aber noch nicht. Bis sich das ändert, ist jede Zahl hier eine Herstellerangabe.
Zweitens vergleicht sich Kolibri in der Ankündigung mit Modellen aus dem Frühjahr. Das Portal Trending Topics hat das am Tag der Veröffentlichung deutlich benannt: Neuere offene Modelle aus China wie GLM-5.3 oder Kimi K3 tauchen im Vergleich nicht auf. Immerhin steht in der großen Tabelle der Modellkarte Qwen3.8 27B, grau gesetzt. Es zeigt, wo die Messlatte im Herbst 2026 liegt.
| Test (Herstellermessung) | Kolibri | Qwen3.6 35B-A3B | Nemotron 3 Super | Mistral Small 4 | Qwen3.8 27B |
|---|---|---|---|---|---|
| Mathematik auf Deutsch (AIME 2026) | 90,0 | 84,4 | 87,5 | 78,5 | 96,9 |
| Fachwissen auf Deutsch (GPQA Diamond) | 81,3 | 80,6 | 76,6 | 72,9 | 88,1 |
| Programmieraufgaben (LiveCodeBench v6) | 85,9 | 82,5 | 82,0 | 71,2 | 93,8 |
| Fehler in echten Code-Projekten beheben (SWE-Bench Verified) | 66,4 | 73,8 | 60,2 | 60,8 | 72,6 |
| Aufgaben im Terminal (TerminalBench 2.1) | 27,7 | k. A. | 39,7 | 21,0 | 76,8 |
| Keine falsche Antwort (AA-Omniscience) | 44,0 | 56,7 | 13,9 | 34,7 | 67,3 |
Lies die Tabelle Zeile für Zeile, dann siehst du die Geschichte. Bei Mathematik und Fachwissen auf Deutsch schlägt Kolibri die drei Vergleichsmodelle aus der Ankündigung. Beim Reparieren echter Code-Projekte liegt Qwen3.6 vorn. Und bei mehrstufiger Arbeit im Terminal liegt Kolibri weit hinter dem dichten Qwen3.8. Agentische Arbeit über viele Schritte ist die offene Baustelle.
Gegen die großen geschlossenen Modelle wie Claude Opus 5.5, GPT-6 oder Gemini 4 Argon tritt Kolibri gar nicht erst an. Das ist auch nicht der Anspruch. Aleph Alpha nennt Kolibri ein spezialisiertes Modell für Verwaltung, Industrie und Luftfahrt, und die Modellkarte sieht es ausdrücklich als Assistenz, deren Ergebnis ein Mensch prüft, nicht als Entscheider.
Wo du Kolibri heute laufen lassen kannst
Bleibt die praktische Frage: Wer bietet Kolibri an? Ich habe am 4. Oktober nachgesehen. Bei OpenRouter, dem großen Marktplatz für Modell-Schnittstellen, gibt es Kolibri nicht, und auch auf Hugging Face hat bis dahin kein einziger Inferenz-Anbieter das Modell in sein Programm aufgenommen. Einen Preis pro Token nennt Aleph Alpha nicht.
Das ist weniger ein Mangel, als es klingt, denn Kolibri ist für den eigenen Betrieb gebaut. Aleph Alpha liefert ein fertiges Paket für vLLM, die verbreitete Open-Source-Software zum Betreiben von Sprachmodellen, als Container oder zum Installieren. Wer will, kann Anpassung und Betrieb beim Hersteller einkaufen. Wer nicht will, braucht niemanden zu fragen.
Auch die Infrastruktur dafür steht in Deutschland. Seit Mai 2025 läuft Aleph Alphas Plattform PhariaAI als Dienst auf STACKIT, der Cloud der Schwarz Gruppe. Dass Kolibri dort oder bei einem anderen europäischen Anbieter wie IONOS oder der Open Telekom Cloud angeboten wird, hatte bis zum 4. Oktober niemand angekündigt, soweit ich finden konnte. Die Apache-Lizenz erlaubt es jedem von ihnen, ohne Rückfrage. Ich wäre überrascht, wenn das lange so bliebe.
Ein Detail gehört allerdings zur Wahrheit. Wenn die Behörden zustimmen, geht Aleph Alpha in Cohere auf. Die neue Firma tritt weltweit als Cohere auf, mit Hauptsitzen in Kanada und Deutschland, und die Schwarz Gruppe stellt dafür 500 Millionen Euro bereit. Das ändert viel. Für die Frage der Unabhängigkeit ist deshalb wichtig, wo Kolibri liegt: mit offenen Gewichten auf Hugging Face. Diese Kopie kann dir keine spätere Firmenstrategie mehr nehmen.
Ein kleiner Vogel zwischen zwei Riesen
Und damit zur großen Bühne. Der AI Index der Stanford University zählt für 2025 59 bedeutende KI-Modelle aus den USA und 35 aus China. Bei den privaten Investitionen ist der Abstand noch größer: 285,9 Milliarden Dollar flossen 2025 in den USA in KI, 12,4 Milliarden in China. Europa taucht in diesen Spitzenwerten nicht auf.
Doch gleichzeitig bewegt sich etwas, und zwar gerade jetzt. Mistral aus Paris hat im September drei Milliarden Euro eingesammelt, bei einer Bewertung von mehr als 21 Milliarden Euro, und Ende des Monats in München einen Standort eröffnet, der sich ausdrücklich an die Industrie richtet. Die EU sucht seit Juli Betreiber für KI-Gigafabriken, riesige Rechenzentren für das Training großer Modelle, mit mehr als 20 Milliarden Euro privatem Kapital als Ziel. Bewerbungsschluss ist der 12. November 2026. Und in Heidelberg trainiert ein Team auf 768 Grafikkarten in drei Wochen ein Modell, das in seiner Klasse vorn mitläuft.
Kolibri schließt den Abstand zu OpenAI, Google oder Alibaba nicht. Das kann ein Modell mit dreieinhalb Milliarden aktiven Parametern auch nicht. Es zeigt etwas anderes: In Deutschland beherrscht wieder ein Team die ganze Kette, von den Rohdaten bis zum fertigen Reasoning-Modell. Zwischen dem internen Vorgänger und Kolibri lagen drei Monate. Aleph Alpha schreibt selbst, das Beständigste aus diesem Jahr sei nicht die Software, sondern genau dieses Team.
Warum ein kleiner Vogel reicht
Ist ein deutsches Modell, das nicht das stärkste der Welt ist, trotzdem ein Grund zur Freude? Ich finde: ja. Und zwar gerade für die Fälle, über die in der KI-Debatte am wenigsten gesprochen wird.
Wenn eine Landesverwaltung Bescheide vorbereitet, ein Zulieferer seine Konstruktionsunterlagen durchsucht oder ein Luftfahrtunternehmen Wartungsakten auswertet, entscheidet nicht der Platz in einer Rangliste. Es entscheidet, ob das Modell im eigenen Haus läuft. Ob es Deutsch wirklich versteht. Ob es zugibt, wenn es etwas nicht weiß. Und ob ihm morgen jemand anderes den Stecker ziehen kann. Wer dafür ein Reasoning-Modell sucht, das nicht aus den USA oder China kommt, hatte bisher wenig Auswahl. Bei diesen vier Fragen hat Kolibri gute Antworten. Bei der Rangliste noch nicht.
Deshalb hoffe ich, dass sich die nächste Version den neuesten Modellen und unabhängigen Tests stellt, damit niemand mehr auf die Zahlen des Herstellers allein angewiesen ist. Bis dahin freue ich mich über einen kleinen Vogel aus Heidelberg. Er ist nicht der größte. Aber er fliegt aus eigener Kraft.
Kurz erklärt
Mixture of Experts
Eine Bauweise für Sprachmodelle, bei der das Modell in viele spezialisierte Teilnetze zerfällt, die Experten. Für jedes Token wählt ein kleiner Verteiler aus, welche wenigen Experten rechnen; der Rest bleibt still. So hat das Modell das Wissen eines großen Netzes, aber die Rechenkosten eines kleinen. Der Haken: Alle Experten müssen trotzdem im Speicher liegen, deshalb braucht ein solches Modell viel Grafikspeicher, aber wenig Rechenzeit.
Offene Gewichte
Die Gewichte sind die gelernten Zahlen eines Modells, sein eigentliches Wissen. Wer sie veröffentlicht, erlaubt allen, das Modell herunterzuladen und auf eigener Hardware zu betreiben, ohne Verbindung zum Hersteller. Das ist nicht dasselbe wie Open Source im strengen Sinn, denn Trainingsdaten und Trainingscode fehlen oft. Für Unternehmen zählt vor allem eines: Eine heruntergeladene Kopie lässt sich nicht mehr abschalten oder nachträglich ändern.
Reasoning
Ein Modell mit Reasoning schreibt vor der Antwort einen Denkprozess auf, eine Art Notizzettel, auf dem es Zwischenschritte prüft und verwirft. Das kostet zusätzliche Token und Zeit, verbessert aber die Ergebnisse bei Mathematik, Logik und mehrstufigen Aufgaben deutlich. Kolibri lässt sich in vier Stufen einstellen, von gar nicht bis gründlich. So entscheidest du je Anfrage, ob dir Tempo oder Sorgfalt wichtiger ist.
Inferenz
Das Ausführen eines fertig trainierten Modells, also jede einzelne Anfrage mit ihrer Antwort. Training passiert einmal und kostet viel, Inferenz passiert bei jeder Frage aufs Neue und summiert sich im Alltag zum größeren Posten. Ein Inferenz-Anbieter betreibt Modelle auf seinen Servern und verkauft den Zugang pro Token. Wer ein Modell selbst betreibt, macht die Inferenz im eigenen Rechenzentrum und gibt keine Daten nach außen.
Halluzination
So heißt es, wenn ein Sprachmodell etwas Falsches mit voller Überzeugung sagt, etwa eine erfundene Quelle oder eine falsche Zahl. Das Modell lügt dabei nicht absichtlich. Es setzt fort, was sprachlich plausibel klingt, auch wenn der Inhalt nicht stimmt. Gegenmittel sind Antworten auf Basis vorgegebener Dokumente und ein Training, das ehrliches Passen belohnt statt bestraft.