Skip to content

Repository files navigation

🏟️ WebGPU-Arena

WebGPU-Arena ist dein privates, WebGPU-beschleunigtes Testlabor für lokale LLMs direkt im Browser. Vergleiche zwei Modelle im Blind-Test oder nutze den Einzel-Chat als sicheren Daily-Driver für deine Fragen – 100% ohne API-Keys, ohne Accounts und ohne Cloud-Zwang.

🚀 Zwei Wege zum Ziel

  1. 🏟️ Arena Mode: Teste zwei Modelle anonym gegeneinander. Wer liefert die bessere Antwort? Dein Voting beeinflusst das globale Leaderboard.
  2. 💬 Einzel-Chat: Ein hochwertiger, privater Chat-Modus mit Modell-Vorschlägen, Markdown-Support und lokaler Historie.

✨ Features v1.3.0

  • Neue Modell-Generation (2025/2026): Qwen3.5 (Vision), Phi-4 mini, Ministral 3 (inkl. Reasoning), Hermes 3, Qwen3 (Thinking-Modus) – die 2024er-Modellreihe wurde archiviert.
  • WebGPU Benchmark: Isolierte Hardware-Messung (MatMul, SAXPY, GEMM) unter /benchmark – GPU vs. CPU im direkten Vergleich.
  • 3B Model Limit: Unterstützung für Champions wie Qwen3.5 4B, Phi-4 mini und Ministral 3 3B.
  • Privacy First: Deine Prompts verlassen niemals dein Gerät.
  • WebGPU-Powered: Die KI läuft dank @mlc-ai/web-llm extrem performant direkt über deine lokale Grafikkarte.
  • Lokal & Persistent: Deine Chat-Historien und ELO-Scores werden lokal gespeichert.
  • PWA-Ready: Installiere die WebGPU-Arena als eigenständige App auf deinem Desktop oder Smartphone.
  • No-Key Security: Sicherer, anonymer Daten-Sync via Supabase Edge Functions.
  • System-Monitoring: Echtzeit-Anzeige von WebGPU-Status und Browser-RAM-Verbrauch.

🚀 Integrierte Modelle

Die Arena nutzt für den Browser kompilierte Modelle (WebLLM-Zoo von mlc-ai). Wir setzen auf das 3B-Limit (Flaggschiffe bis 4B), um den idealen Mix aus Qualität und Speed zu bieten:

  • Qwen3.5 4B: Das neue Flaggschiff (2026). Vision-fähig, 262k Kontext, schlägt viele 20B-Modelle im Benchmark.
  • Phi-4 mini (3.8B): Microsofts Reasoning-Spezialist. Extrem starke Logik und Mathematik.
  • Ministral 3 3B: Mistral aktueller Champion (12/2025) inkl. Reasoning-Variante mit Chain-of-Thought.
  • Hermes 3 3B: Nous-Research-Finetune – der Nachfolger des Llama-3.2-Champions.
  • Qwen3.5 2B: 2026er-Generation im kompakten Format, Vision & Text.
  • Qwen3 1.7B: Mit schaltbarem Thinking-Modus – stark in Mathe, Code und Logik.
  • Qwen 2.5 3B: Solider Allrounder, exzellente Mehrsprachigkeit.
  • Gemma 3 1B: Googles neue 1B-Generation für maximale Speed.

Archiv: Die 2023/2024er-Modellreihe (Llama 3.2, Gemma 2, SmolLM2, Qwen 2.5 0.5B/1.5B, TinyLlama) ist ausgemustert und wird nur noch in der ELO-Historie geführt.

image

🛠️ Lokales Setup für Entwickler

Da die App als reine Frontend-Applikation läuft, benötigst du kein Backend:

# 1. Repository klonen
git clone https://github.com/ogerly/webgpu-arena.git
cd webgpu-arena

# 2. Abhängigkeiten installieren
npm install

# 3. Entwicklungsserver starten
npm run dev

🌐 Deployment (Hugging Face Space)

Dieses Projekt ist "Serverless" und wird auf einem Hugging Face Space (Docker/nginx) gehostet: https://huggingface.co/spaces/ogerl/webgpu-arena

Deploy-Prozess:

# 1. Build mit relativen Pfaden (für den Space)
VITE_BASE_URL=./ npm run build

# 2. Inhalt von dist/ in den Space-Repository-Workspace kopieren (inkl. Dockerfile + Space-README)
# 3. Commit + Push an den Space
git push hf main

Sicherheit: API-Tokens (HuggingFace, Supabase) leben nur in .env bzw. im Betriebssystem-Credential-Store — niemals im Code, in Commits oder im Space.

⚠️ Systemanforderungen für Nutzer

Damit die KI im Browser läuft, wird Folgendes benötigt:

  • Ein moderner Webbrowser (empfohlen: Google Chrome oder Microsoft Edge).
  • WebGPU muss unterstützt und aktiviert sein (falls es standardmäßig nicht aktiv ist, im Browser chrome://flags/#enable-unsafe-webgpu auf Enabled setzen).
  • Speicherplatz: Beim erstmaligen Laden werden die Modelldaten im Browser-Cache gespeichert (ca. 0.5 bis 2 GB pro Modell).

📄 Lizenz & Beitrag

Dieses Projekt ist Open Source. Fühle dich frei, die Arena zu forken, Pull Requests zu erstellen oder eigene Modelle (q4f16_1-MLC) hinzuzufügen!

🧠 AAMS - Agent-Assisted Management System

Die Entwicklung der WebGPU-Arena folgt dem AAMS-Prinzip. Dies stellt sicher, dass die Zusammenarbeit zwischen Mensch und KI strukturiert, dokumentiert und jederzeit nachvollziehbar bleibt. (Repository)

  • Whitepapers: Architektur-Entscheidungen und "Source of Truth".
  • Workpapers: Aktuelle Aufgaben und Implementierungsschritte.
  • Archive: Dokumentation abgeschlossener Meilensteine.

⚖️ Disclaimer & Haftungsausschluss

Dies ist ein privates Projekt. Die Nutzung der WebGPU-Arena erfolgt auf eigene Gefahr und Verantwortung.

  • Keine Gewähr: Es wird kein Anspruch auf Funktionalität, Support oder Datensicherheit erhoben.
  • Datenschutz-Garantie: Ich garantiere, dass bei Standardnutzung keine Daten dein Gerät verlassen. Die Anwendung ist konsequent auf lokale Autonomie ausgelegt.
  • Verantwortung: Jeder Nutzer ist für die Einhaltung lokaler Gesetze und die Verwendung der generierten Inhalte selbst verantwortlich.

💬 Austausch & Feedback

Ich freue mich über jede Form von Austausch! Ob Bug-Reports, Feature-Ideen oder einfach nur ein Gespräch über die Zukunft der lokalen KI – melde dich gerne über GitHub Issues oder direkt bei mir.

Gebaut mit 🤖 Support für maximale Entwickler-Effizienz.

Releases

Packages

Used by

Contributors

Languages