cyberivy
Jev UltrafastBrowser UseBrowser AutomationAI AgentsDeveloper ToolsOpen Source AITypeSafeMIT License

Jev Ultrafast beschleunigt Browser-Agenten mit strukturierten Aktionen

28. September 2026

Browserfenster mit einer Flugsuche, deren anklickbare Felder und Schaltflächen nummeriert markiert sind

Jev Ultrafast steuert Webseiten über eine nummerierte Liste sichtbarer Elemente statt über Screenshots. Das spart Modellaufrufe, bleibt aber ein junges und klar begrenztes Werkzeug.

Worum es geht

Jev Ultrafast ist ein offenes Werkzeug von Browser Use und TypeSafe für automatisierte Browseraufgaben. Statt eine Webseite ständig als Bild an ein großes Sprachmodell zu senden, liest der Agent sichtbare Bedienelemente aus dem DOM, nummeriert sie und lässt ein Modell zwischen wenigen zulässigen Aktionen wählen. Das Projekt erschien im September 2026 unter der MIT-Lizenz und kann lokal mit einem vorhandenen Chrome-Profil ausprobiert werden.

Der Ansatz ist für Teams interessant, die Browser-Agenten bauen oder deren Laufzeit und Kosten untersuchen. Er ist kein fertiger Assistent für beliebige Büroarbeit, sondern eine kleine Python-Bibliothek mit lokalem Inspektor und nachvollziehbaren Beispielabläufen.

Was Jev Ultrafast tatsächlich macht

Nach jedem Seitenschritt erzeugt das Werkzeug eine Tabelle der sichtbaren Steuerelemente: Schaltflächen, Eingabefelder, Auswahlfelder und ihre aktuellen Werte. Das Jev-Modell entscheidet gleichzeitig über die nächste Operation und das dazu passende Ziel. Nur wenn Text eingegeben werden muss, erzeugt ein separates kleines Sprachmodell den Inhalt.

Die ausführbaren Operationen sind bewusst eng: klicken, Text eingeben, auswählen, scrollen, warten, fertig melden oder eine Blockade melden. Vor einer Eingabe prüft der Executor, ob das beobachtete Element noch aktuell und nicht verdeckt ist. Modellantworten werden nicht als CSS-Selektoren, Koordinaten, JavaScript oder Shell-Befehle ausgeführt.

Die Referenzimplementierung verbindet sich über Browser Harness mit Chrome. Ein lokaler Inspektor zeigt Elemente, Wahrscheinlichkeiten und Aktionen; im Modus „Choose next“ kann ein Mensch jeden Schritt vor der Ausführung anhalten. Für Text benötigt das Beispiel zusätzlich einen kompatiblen Modellzugang.

Warum das wichtig ist

Bildbasierte Browser-Agenten übertragen viele Pixel, obwohl für einen Schritt oft nur wenige sichtbare Steuerelemente relevant sind. Jev Ultrafast reduziert diese Entscheidung auf eine dynamische, typisierte Aktionsmenge. Das kann Latenz, Tokenverbrauch und Fehlbedienungen verringern und macht den Kontrollfluss leichter prüfbar.

Das Repository dokumentiert einen Google-Flights-Test mit 7,073 Sekunden Laufzeit. In sechs abwechselnden Versuchen bestanden beide verglichenen Varianten jeweils drei von drei Läufen; der Median sank laut Projekt von 9,450 auf 7,092 Sekunden. Das ist ausdrücklich kein allgemeiner Benchmark: Es handelt sich um eine Aufgabe, ein Browserprofil und wenige Wiederholungen. Der Wert des Projekts liegt deshalb stärker in der offen einsehbaren Architektur und den Messgrenzen als in einer einzelnen Geschwindigkeitszahl.

Einfach erklärt

Statt einem Helfer nach jedem Schritt ein Foto eines ganzen Supermarkts zu schicken, gibt Jev ihm eine aktuelle Liste: „1 Eingang, 2 Einkaufswagen, 3 Obstregal“. Der Helfer wählt nur eine erlaubte Handlung und die passende Nummer. Das spart Informationen, funktioniert aber nur, solange wichtige Dinge sauber in der Liste auftauchen.

Praktisches Beispiel

Ein Reiseteam möchte täglich prüfen, ob für eine Strecke passende Flüge sichtbar sind. Der Agent öffnet die Suchseite, erkennt zehn relevante Eingaben und füllt Abflugort, Ziel und Datum nacheinander aus. Nach jedem Schritt bestätigt ein unabhängiger Prüfer, ob Route und Datum tatsächlich auf der Ergebnisseite stehen. Bei 100 Durchläufen protokolliert das Team Laufzeit, Modellkosten, blockierte Elemente und falsche Fertigmeldungen, bevor es über einen produktiven Einsatz entscheidet.

Der sinnvolle erste Test ist kleiner: Repository klonen, Schlüssel in einer lokalen Umgebung setzen, das mitgelieferte Wikipedia-Beispiel ausführen und anschließend einen eigenen, ungefährlichen Leseablauf ergänzen. Buchungen, Zahlungen und Kontoeinstellungen sollten zunächst ausgeschlossen bleiben.

Einordnung und Grenzen

Erstens verarbeitet der DOM-Leser gängige HTML- und ARIA-Elemente, aber noch nicht zuverlässig alle Shadow Roots, Frames, Canvas-Oberflächen, Uploads, Pop-up-Tabs oder ungewöhnlichen Tastaturkomponenten. Fehlt ein Element in der Beobachtung, kann der Agent es nicht sinnvoll bedienen.

Zweitens ist die veröffentlichte Leistungsmessung klein und auf wenige Aufgaben beschränkt. Aus dem schnellen Flugtest folgt keine belegte Zuverlässigkeit auf beliebigen Webseiten. Drittens verwendet der Agent das vorhandene Chrome-Profil. Dadurch kann er angemeldete Sitzungen erreichen; Betreiber müssen Testprofile, geringe Rechte, Freigaben und Schutz vor Prompt Injection selbst einrichten. Auch eine „DONE“-Entscheidung braucht eine unabhängige Ergebnisprüfung.

SEO- und GEO-Schlüsselbegriffe

Jev Ultrafast, Browser Use, TypeSafe Jev, Browser-Agent, Browserautomatisierung, strukturierte Aktionen, DOM-Agent, Browser Harness, Open Source AI, MIT-Lizenz

💡 Im Klartext

Jev Ultrafast lässt einen Browser-Agenten aus einer nummerierten Liste sichtbarer Bedienelemente wählen. Das kann schneller und sparsamer sein als ständige Bildanalyse, deckt aber noch nicht jede Weboberfläche ab.

Wichtigste Erkenntnisse

  • →Der Agent arbeitet standardmäßig mit strukturierten DOM-Daten statt mit Screenshots.
  • →Operation und passendes Ziel werden in einem Modellaufruf gewählt.
  • →Die Referenzimplementierung ist MIT-lizenziert und lokal prüfbar.
  • →Die veröffentlichten Geschwindigkeitswerte stammen aus wenigen, eng begrenzten Tests.
  • →Angemeldete Browserprofile erfordern geringe Rechte und unabhängige Ergebnisprüfungen.

Häufige Fragen

Ist Jev Ultrafast ein fertiger Büroassistent?

Nein. Es ist eine junge Python-Bibliothek und Referenzimplementierung für Entwickler von Browser-Agenten.

Braucht das Werkzeug ein Sprachmodell?

Ja. Jev trifft die Aktionsentscheidung; für Texteingaben nutzt das Beispiel zusätzlich ein kompatibles kleines Modell.

Kann es jede Webseite bedienen?

Nein. Frames, Canvas, Uploads, Pop-ups und weitere Oberflächen sind laut Projekt noch eingeschränkt.

Darf der Agent mit meinem normalen Browserprofil arbeiten?

Technisch ja, aber ein getrenntes Testprofil mit geringen Rechten ist für erste Versuche deutlich sicherer.

Quellen & Kontext