ToolNavs KI-Tools entdecken
Tool einreichen Anmelden
Zurück zu KI ist Open Source
Browser Use: Open-Source-Browser-Agent – drei Kosten, bevor die KI für dich klickt

Browser Use: Open-Source-Browser-Agent – drei Kosten, bevor die KI für dich klickt

KI ist Open Source • Admin • • 2 Aufrufe

Browser Use ist ein Open-Source-Browser-Agent: Man gibt ihm eine Anweisung, und er öffnet tatsächlich einen Browser, klickt Links an, füllt Formulare aus, blättert Seiten um, schließt Pop-ups und bringt das Ergebnis zurück. Er tut nicht so, als würde er aus dem Chatfenster 'im Internet surfen', und erfindet keine Antworten – er lässt die KI den Browser wie einen Menschen benutzen. Er eignet sich für alle mit echtem Web-Automatisierungsbedarf, nicht für neugierige Leser, die nur mal hineinschnuppern wollen und beim Anblick der Kommandozeile Kopfschmerzen bekommen.

Der wesentliche Unterschied zu 'Websuche' und 'Plugin'-Ansätzen

Die Websuche gibt einem großen Sprachmodell genau eine Chance zum 'Nachschlagen': suchen, lesen, antworten, fertig. Ein Browser-Plugin nagelt seine Fähigkeit an eine einzelne Website fest. Browser Use geht einen dritten Weg: die Agentenschleife. In jedem Schritt beobachtet er den Seitenzustand, entscheidet die nächste Aktion (Klick, Eingabe, Scrollen, Warten) und kann bei Fehlern zurückgehen und es erneut versuchen. Mehrstufige Aufgaben wie 'vergleiche Preise auf drei Websites und erstelle eine Tabelle' erledigt er seitenübergreifend selbstständig; eine suchbasierte Antwort kann nur einen Stapel Links liefern, und die restlichen Klicks bleiben deine Aufgabe.

Warum er so beliebt wurde

Drei Dinge kamen zusammen. Erstens gehörte er zu den frühesten Open-Source-Projekten, die 'KI bedient den Browser' als sofort einsetzbares Werkzeug verpackten – mit über 110.000 Sternen auf GitHub eines der meistbeachteten Repositories in diesem Bereich. Zweitens sind alle drei Wege geebnet: eine kostenlose lokale Python-Bibliothek, eine CLI für bestehende Agenten und eine vollständig verwaltete Cloud-API – Einsteiger und Produktivnutzer nehmen jeweils, was sie brauchen. Drittens ist die Modellauswahl völlig offen: OpenAI, Claude und Gemini lassen sich anbinden, es gibt das eigene für Browser-Automatisierung optimierte BU2-Modell, und lokale Ollama-Modelle werden unterstützt – Rechnung und Datenschutz bestimmt man selbst.

Offizielle Repository-Informationen

Plattform: GitHub; Organisation: browser-use; Projekt: browser-use; Lizenz: MIT. Die Ein-Satz-Positionierung des Repositories lautet 'Agents that use the browser.' Ein Hinweis: Es gibt Schwester-Repositories wie Browser Harness (ein Kommandozeilenwerkzeug, das KI-Agenten die Kontrolle über den Browser gibt) – wer das falsche Repository erwischt, läuft einen Umweg.

Repository-Adresse (kein Link, nur zum Abgleich): github.com/browser-use/browser-use

Vor dem Einsatz: diese drei Kosten sauber durchrechnen

Kostenpunkt eins: die Modell-Token-Rechnung. Die Kernlogik von Browser Use ist 'das große Sprachmodell sieht bei jedem Schritt die Seite und entscheidet' – der DOM-Text der Seite landet bei jedem Schritt im Modell, und dass eine Aufgabe zigtausend Token verbrennt, ist normal; der Vision-Modus (bei jedem Schritt ein Screenshot ans multimodale Modell) kostet noch mehr. Der Schlüssel zur Kostenkontrolle ist 'günstiges Modell plus DOM-Modus' – Vision nur dort, wo Text wirklich versagt.

Kostenpunkt zwei: Bot-Abwehr und CAPTCHAs. Die lokale Open-Source-Edition löst keine CAPTCHAs – stößt sie auf eine menschliche Prüfungswand wie die von Cloudflare, kann der Agent nur auf die Wand starren und gerät sogar in eine 'erneut versuchen – blockiert – erneut versuchen'-Endlosschleife, die Token umsonst verbrennt. Die offizielle Antwort ist der Cloud-Stealth-Browser (mit Proxys und CAPTCHA-Behandlung), aber das ist ein nutzungsbasierter Dienst.

Kostenpunkt drei: lokale Umgebung oder Cloud-Dienst. Lokal braucht man Python 3.11 oder höher, alle Schnittstellen sind asynchrone Aufrufe, Headless-Chrome frisst ohnehin Speicher, und bei steigender Parallelität gibt zuerst die Maschine auf; Nutzer in Festlandchina können außerdem in die Falle tappen, dass der Download der Standard-Erweiterungen nicht durchkommt. Cloud-Browser werden pro Browser-Stunde abgerechnet (ca. 0,02 US-Dollar), die Modell-Inferenz extra; Neuanmeldungen erhalten 15 Dollar Guthaben – genug zum Ausprobieren, für den Dauerbetrieb muss man selbst rechnen. Ein lokales Ollama-Modell kann null Inferenzkosten bedeuten, doch das Ergebnis hängt direkt an der Hardware.

Für wen er passt, für wen nicht

Passt: alle mit echtem Web-Automatisierungsbedarf (Preisvergleiche im Stapel, Formulare, Datenerfassung); Entwickler, die lernen wollen, wie eine Agentenschleife programmiert ist; technisch versierte Nutzer, die eine Python-Umgebung nicht scheuen.

Passt nicht: Neugierige, die nur 'zusehen wollen, wie die KI klickt' (Lernkurve vorhanden, Cloud ist ebenfalls nutzungsbasiert); wer Bot-Abwehr umgehen und im großen Stil scrapen will (das kann die Open-Source-Edition nicht, und es kann gegen Website-Bedingungen verstoßen); Nutzer mit schwacher Hardware, die nicht für Cloud-Dienste zahlen wollen.

Empfohlene Tools

Mehr