Pooled verteilt lokale Sprachmodelle auf mehrere Browser
7. Oktober 2026
Pooled bündelt die Rechenleistung von Laptops und Smartphones über WebRTC. So laufen offene Sprachmodelle im Browser, die für ein einzelnes Gerät zu groß wären.
Worum es geht
Pooled ist ein quelloffenes Werkzeug, das ein Sprachmodell auf mehrere Geräte verteilt. Teilnehmende öffnen einen Raum im Browser; Laptop, Desktop oder Smartphone übernehmen jeweils einen Teil der Modellschichten. Der frühere Projektname SwarmLLM wurde inzwischen durch Pooled ersetzt.
Das ist vor allem für Menschen interessant, die offene Modelle lokal ausprobieren möchten, deren Speicherbedarf ein einzelnes Gerät übersteigt. Der Ansatz benötigt weder ein Benutzerkonto noch eine Installation auf jedem beteiligten Gerät. Für sensible Daten bleibt trotzdem entscheidend, wer dem Raum beitritt und welche Inhalte sichtbar sind.
Was Pooled tatsächlich macht
Pooled lädt auf jedes Gerät nur die zugewiesenen Modellschichten. Die Berechnung läuft mit eigenen WGSL-Kernels über WebGPU. Für jedes erzeugte Token wandert ein kleiner versteckter Zustandsvektor über direkte WebRTC-Verbindungen von Gerät zu Gerät. Der Host setzt daraus die Ausgabe zusammen.
Das Projekt unterstützt laut Dokumentation mehrere Qwen-Modelle. Für Qwen 3.8 27B nennt es ungefähr 17 GB verteilten Speicherbedarf; Qwen 3.6 35B MoE benötigt rund 22,5 GB. Diese Werte stammen vom Projekt und sind keine unabhängigen Messungen. Modellteile werden lokal zwischengespeichert. Verlässt ein Gerät den Raum, können dessen Schichten neu verteilt werden.
Neben dem Chat gibt es einen Code-Modus. Er kann kleine Webanwendungen in einer abgeschotteten Vorschau erzeugen, Konsolenfehler lesen und Änderungen vorschlagen. Zugriffe auf einen echten Ordner müssen vom Host bestätigt werden. Über eine lokale Brücke lässt sich der Raum außerdem mit Clients verbinden, die OpenAI- oder Anthropic-kompatible APIs sprechen.
Warum das wichtig ist
Lokale Inferenz scheitert oft nicht an der reinen Rechenleistung, sondern am verfügbaren Speicher. Pooled behandelt mehrere vorhandene Geräte wie ein gemeinsames Regal für Modellschichten. Das kann Tests ermöglichen, ohne sofort einen Rechner mit sehr viel RAM oder eine Cloud-GPU zu mieten.
Der Browser senkt zugleich die Einstiegshürde: Weitere Geräte treten über einen Link bei. Das Projekt dokumentiert Architektur, Bedrohungsmodell und Benchmarks öffentlich und steht unter der MIT-Lizenz. Für Teams ist auch die API-Brücke relevant, weil vorhandene Coding- oder Chat-Clients einen Pooled-Raum als Modellendpunkt nutzen können.
Der praktische Nutzen hängt jedoch stark vom Netzwerk ab. Jeder zusätzliche Teilnehmer verlängert den Weg eines Tokens. Firmennetze können direkte WebRTC-Verbindungen blockieren; dann ist ein TURN-Relay nötig. Pooled ist deshalb eher ein gut prüfbares Experimentierwerkzeug als ein Ersatz für einen stabilen Inferenzserver.
Einfach erklärt
Stellen Sie sich einen sehr dicken Bildband vor, den kein einzelner Rucksack tragen kann. Pooled teilt die Kapitel auf mehrere Personen auf. Bei jeder Frage reichen sie eine kleine Notiz in fester Reihenfolge weiter, bis die Antwort wieder beim Gastgeber ankommt. Je weiter die Personen voneinander entfernt sind, desto länger dauert jede Runde.
Praktisches Beispiel
Eine Entwicklerin möchte ein offenes 27-Milliarden-Parameter-Modell testen. Ihr Laptop kann nur 10 GB für das Modell bereitstellen, zwei weitere Geräte jeweils 4 GB und 5 GB. Zusammen überschreiten sie den vom Projekt genannten Bedarf von rund 17 GB. Alle drei öffnen denselben Raum und laden nur ihre Modellschichten.
Danach verbindet die Entwicklerin einen lokalen Coding-Client über die bereitgestellte API-Brücke. Ein Prompt mit Quellcode läuft über die drei Geräte. Bevor echte Projektdateien verändert werden, muss sie den Ordnerzugriff bestätigen. Anschließend misst sie Antwortzeit, Stabilität und Stromverbrauch gegen ein kleineres Modell, das allein auf dem Laptop läuft. Erst wenn der Mehrwert die zusätzliche Netzwerklatenz rechtfertigt, bleibt Pooled im Testaufbau.
Einordnung und Grenzen
Erstens sind die Leistungswerte projektintern. Hardware, Browser, Modell und Netzwerklatenz verändern das Ergebnis erheblich; ein nativer Inferenzserver kann schneller sein.
Zweitens sehen je nach Raumeinstellung der Host und weitere Teilnehmende Prompts oder Antworten. Vertraulicher Code gehört nur in einen Raum mit klar kontrollierten Mitgliedern. WebRTC und ein mögliches Relay ersetzen keine organisatorische Zugriffskontrolle.
Drittens hängt eine Anfrage von allen beteiligten Geräten ab. Schlafmodus, geschlossene Tabs, Speicherdruck oder schwaches WLAN können den Lauf stören. Wer garantierte Verfügbarkeit, langen Kontext oder reproduzierbare Produktionsleistung braucht, sollte einen etablierten lokalen oder gehosteten Server bevorzugen.
Der sinnvolle nächste Schritt ist ein Test mit zwei eigenen Geräten, einem unkritischen Modell und öffentlichen Beispieldaten. Dabei sollten Zeit bis zum ersten Token, Durchsatz, Ausfallverhalten und Sichtbarkeit der Prompts protokolliert werden.
SEO- und GEO-Schlüsselbegriffe
Pooled, SwarmLLM, lokale KI, Browser-Inferenz, WebGPU, WebRTC, verteilte Sprachmodelle, offene Modelle, Qwen, Coding-Agenten, Peer-to-Peer-Inferenz
💡 Im Klartext
Pooled teilt ein großes offenes Sprachmodell auf mehrere Browser-Geräte auf. Das kann lokale Tests ermöglichen, macht Geschwindigkeit und Verfügbarkeit aber vom Netzwerk und allen beteiligten Geräten abhängig.
Wichtigste Erkenntnisse
- →Pooled verteilt Modellschichten über WebGPU und WebRTC auf mehrere Geräte.
- →Teilnehmende treten per Browser-Link bei; ein Konto ist nicht nötig.
- →Eine lokale Brücke bietet OpenAI- und Anthropic-kompatible Schnittstellen.
- →Prompts können je nach Raumeinstellung für weitere Teilnehmende sichtbar sein.
- →Projektbenchmarks sollten auf eigener Hardware überprüft werden.
Häufige Fragen
Braucht Pooled auf jedem Gerät eine Installation?
Nein. Für die Teilnahme am Rechenraum genügt ein kompatibler Browser mit WebGPU; die optionale API-Brücke läuft lokal separat.
Bleiben alle Daten ausschließlich auf einem Gerät?
Nein. Versteckte Modellzustände werden zwischen den beteiligten Geräten übertragen, und Prompts oder Antworten können je nach Einstellung für Raumteilnehmende sichtbar sein.
Ist Pooled für Produktion geeignet?
Das Projekt ist vor allem für Tests interessant. Produktionsbetrieb verlangt eigene Prüfungen zu Latenz, Ausfällen, Zugriffskontrolle und Browserkompatibilität.