# KI-Agenten haben einen Google-Chip ohne Handbuch programmiert

KI-Agenten haben in rund 22 Stunden Treiber und Compiler für Googles undokumentierten Coral-Chip gebaut, jetzt laufen alle sechs Schichten eines kleinen Sprachmodells auf dem 60-Dollar-Stick.

## Das Experiment

Der Google Coral USB Accelerator ist ein KI-Beschleuniger im Format eines USB-Sticks. Er kostet rund 60 Dollar. Google liefert dazu einen Compiler, der fertige Modelle für den Chip übersetzt. Transformer, also die Bauart heutiger Sprachmodelle, kann er nicht übersetzen. Wie der Chip intern programmiert wird, hat Google nie veröffentlicht.

Am 1. Oktober 2026 habe ich den Stick an mein MacBook gesteckt und KI-Agenten eine kurze Aufgabe gegeben: Bringt tinygrad auf diesen Chip, mit eigenem Compiler statt dem von Google. tinygrad ist ein schlankes Open-Source-Framework für neuronale Netze, klein genug, dass ein Agent den ganzen Code überblickt. Ein Pflichtenheft gab es nicht. Dazu kam ein Rat: schnelle Feedback-Schleifen.

## Was die Agenten gebaut haben

Ein koordinierender Agent hat die Arbeit zerlegt und Teilaufgaben an 23 weitere Agenten vergeben. Vier davon haben parallel je eine Befehlsfamilie des Chips entschlüsselt. Am Ende standen:

- ein USB-Treiber in Python, der ohne Googles Laufzeitbibliothek auskommt,

- der entschlüsselte Befehlssatz, dokumentiert Instruktion für Instruktion,

- ein eigener Code-Generator für den Chip,

- ein Backend, über das tinygrad Modelle direkt auf dem Stick ausführt.

Der Prüfstein war streng. Wo Googles Compiler ein Gegenstück erzeugen kann, wurde jedes eigene Programm Byte für Byte damit verglichen. Die Ergebnisse auf dem Chip wurden Bit für Bit mit einem Rechenmodell auf dem Laptop abgeglichen.

Nach rund 22 Stunden liefen alle sechs Transformer-Schichten des Sprachmodells TinyStories-15M auf dem Chip, mit einem einzigen Chip-Aufruf pro Token. Das ergibt 176,7 Token pro Sekunde bei einem einzelnen Text. Googles eigener Compiler kann dieses Modell nicht übersetzen. Einen großen Teil der Nacht haben die Agenten ohne mich gearbeitet.

## Meine Rolle

Ich habe das Ziel gesetzt und entschieden, wenn eine Richtung zu wählen war. Zum Beispiel: ein echtes tinygrad-Backend, das gewöhnliche Modelle übernimmt, statt einer Speziallösung für ein einziges Modell. Und: alle Schichten des Sprachmodells auf den Chip, nicht nur die Matrixmultiplikationen. Ich habe Grenzen gezogen: keine Eingriffe in das tinygrad-Projekt, keine Veröffentlichung ohne mein Okay. Für das Video gab es ein Budget von zwei Dollar für externe KI-Dienste, gebraucht wurden 22 Cent.

Dazu kam Handarbeit. Wenn der Stick hing, habe ich ihn ab- und wieder angesteckt, etwa ein halbes Dutzend Mal. Dann haben die Agenten dem Treiber beigebracht, einen hängenden Chip selbst zurückzuholen: offene USB-Übertragungen abräumen, den Chip neu initialisieren, ein Kontrollprogramm laufen lassen, das bitgenau stimmen muss. Die nächsten vier Hänger kamen ohne mich aus.

## Was schwierig war

Anfangs hing der Stick immer wieder. Den entscheidenden Hinweis fanden die Agenten in einem Kommentar im Quellcode von Googles Treiber: Neue Daten dürfen nicht losgeschickt werden, solange der Chip noch Ergebnisse senden will. Sonst blockiert die USB-Verbindung.

Dazu kamen Regeln, die nirgends dokumentiert sind. Parameter müssen auf 256 Byte ausgerichtet sein. Der Chip rundet Halbwerte zur geraden Zahl, anders als Googles Referenz in TFLite. Nach einer L2-Normierung ist eine Hilfszeile im Speicher unbrauchbar, und eine Sigmoid-Funktion direkt danach legt den Chip lahm. Gefunden haben die Agenten solche Regeln, indem sie Abstürze und Abweichungen Schritt für Schritt eingegrenzt haben.

Manche Fehler waren still. Ein Bildmodell erkannte auf dem Chip nur 11 Prozent der Testbilder richtig, im Simulator 90 Prozent. Ein Abgleich Aufruf für Aufruf fand zwei Ursachen. Eine davon: Programme überschrieben mit ihren Arbeitspuffern die Gewichte anderer Schichten.

## Was das für Ihr Unternehmen bedeutet

Erstens: Agenten können anspruchsvolle Ingenieursarbeit von Anfang bis Ende übernehmen. Hier waren es Reverse Engineering, Treiber, Compiler, Tests und Dokumentation, am Ende auch Schnitt und Vertonung des Videos. Entscheidend waren nicht lange Anweisungen, sondern ein objektiver Prüfstein, schnelle Rückmeldung und klare Leitplanken. Nur ein Prozess durfte gleichzeitig an die Hardware, beim ersten Fehler war Schluss, und alles Unumkehrbare lag bei mir.

Zweitens: Kleine, lokale Hardware kann Modelle selbst ausführen. Die Daten verlassen dabei das Haus nicht. tinygrads Beispielmodell zur Ziffernerkennung (MNIST) verarbeitete auf dem Stick knapp 23.000 Bilder pro Sekunde. Für eng umrissene Aufgaben, etwa eine Gut/Schlecht-Prüfung am Band, genügen oft solche kleinen Modelle.

Drittens: Hardware ohne passende Software des Herstellers ist nicht mehr zwingend eine Sackgasse. Mit einer Referenz und einem Testaufbau können Agenten die Lücke schließen.

## Die Grenzen

- TinyStories-15M ist ein sehr kleines Modell mit 15 Millionen Parametern. Es schreibt einfache Kindergeschichten auf Englisch. Größere Modelle passen nicht in die 8 MiB Gewichtsspeicher des Chips.

- Der Chip rechnet mit 8-Bit-Ganzzahlen. Das kostet messbar Genauigkeit (Perplexität 2,13 statt 1,88), die Geschichten bleiben aber zusammenhängend.

- Die Grafikeinheit meines Laptops ist schneller: 316 Token pro Sekunde mit demselben Modell. Der Stick ist für schwache Rechner gedacht.

- Einen Teil der Arbeit erledigt weiter der Laptop, vor allem die Ausgabeschicht über 32.000 Token. Sie passt neben den sechs Schichten nicht mehr auf den Chip.

- Das Programm für das ganze Modell läuft noch an tinygrads Scheduler vorbei.

- Die Agenten haben nicht bei null angefangen. George Hotz hatte mit edgetpuxray eine erste Karte des Chips veröffentlicht. Googles offener Treiber lieferte Registernamen und Firmware, Googles Compiler diente als Referenz.

- Entwickelt und gemessen wurde auf einem Mac mit einem einzigen Stick.

Code, Video und Thread sind unten verlinkt. Das tinygrad-Projekt hat den Beitrag auf X geteilt, bis zum 5. Oktober wurde er gut 25.000 Mal angesehen.

## Links

- [Der Code auf GitHub](https://github.com/FrederikRogalski/tinycoral)
- [Video und Thread auf X](https://x.com/xlagor_/status/2106501124479959282)
- [Das Video auf YouTube](https://youtube.com/shorts/136F8-ph_hQ)

Quelle: https://revoki.de/de/blog/tinycoral
