23. August 2026 · Von YasKad
AlexsJones/llmfit

llmfit: lokale Modelle anhand der echten Hardware auswählen

AlexsJones/llmfit · 37.154★ · 2.368 forks

Alles Wissenswerte über AlexsJones/llmfit: ein Terminal-Werkzeug und eine interaktive Oberfläche, die eine Maschine erkennt und lokale Modelle nach Eignung, geschätzter Geschwindigkeit, Qualität und Kontext ordnet.


Was llmfit ist

llmfit hilft zu entscheiden, welches lokale Sprachmodell auf einer bestimmten Maschine gut laufen kann. Es erkennt RAM, CPU, GPU, VRAM und installierte Anbieter; anschließend bewertet es den Katalog nach Speichereignung, Geschwindigkeit, Qualität und Kontext. Standardmäßig bietet es eine interaktive Terminaloberfläche und einen Kommandozeilenmodus für Automatisierung.

Ultra-detaillierte, dunkle Cyberpunk-Illustration eines leuchtenden, neon-umrandeten Computer-Mainboards. RAM-Module und eine massive GPU leuchten in kräftigem Cyan und Magenta, während holografische Datenströme die Hardwarekomponenten abtasten und die Phase der Hardwareerkennung und Systemprüfung darstellen.

Das Repository dokumentiert Kompatibilität mit Ollama, llama.cpp, MLX, Docker Model Runner und LM Studio sowie Multi-GPU-Konfigurationen, MoE-Architekturen und dynamische Quantisierungsauswahl. Es führt nicht zwingend jeden Kandidaten aus, um ihn zu empfehlen: Seine Schätzungen gehen von Spezifikationen aus und legen ihre Annahmen über llmfit info offen; die Benchmark-Suite erlaubt es, Schätzungen durch eigene Messungen zu ersetzen.

Ultra-detaillierte Dark-Mode-Cyberpunk-Visualisierung eines futuristischen Datenmarktplatzes. Abstrakte holografische Container, beschriftet mit verschiedenen KI-Modellnamen, werden von Roboterarmen sortiert und gescannt, die Neon-Laserstrahlen aussenden, während die Modelle auf einer leuchtenden Neon-Rangliste eingeordnet werden.

Der Ursprung: von der Rechtfertigung eines Laptops zur Katalogisierung der Eignung

Alex Jones erstellte das Repository am 15. Februar 2026. Ihr Profil beschreibt sie als Principal Engineer bei AWS, ihre Arbeit als Infrastruktur für das Zeitalter der Agenten.

Ultra-detailliertes, Cyberpunk-inspiriertes 3D-Rendering eines eleganten Laptops, der ein massives, leuchtendes holografisches neuronales Netzwerk ausstrahlt. Das Hologramm bildet eine perfekte Sphäre aus miteinander verbundenen Neonknoten, die über dem Laptop-Bildschirm schwebt, getaucht in tiefes Neonblau und violettes Licht, und stellt den Ursprung des Werkzeugs dar: die Rechtfertigung des Kaufs eines leistungsstärkeren Laptops zum Ausführen lokaler KI-Modelle.

Der auf Hacker News gefundene Launch, eingereicht vom Konto axjns am 17. Februar 2026, liefert den direktesten Kontext: Die Autorin bzw. der Autor schrieb, das Tool sei gebaut worden, um den Kauf eines leistungsstärkeren Laptops zu rechtfertigen. Die Einreichung, Thread 47045434, hatte im konsultierten Index 1 Punkt und 0 Kommentare; sie belegt die anfängliche Vorstellung, keine unabhängige Rezeption.

Philosophie und Prinzipien

Der Ansatz bevorzugt überprüfbare Entscheidungen gegenüber einer generischen Modellliste: Das Werkzeug zeigt die Eignung und die Grundlage seiner Schätzungen und weist die Nutzerin bzw. den Nutzer darauf hin, dies auf der eigenen Maschine zu verifizieren. Der Community-Ablauf setzt diese Idee fort: Eine lokale Messung wird zuerst gespeichert und nur optional über einen Pull Request geteilt; akzeptierte Messungen fließen in zukünftige Releases für identische Maschinen ein.

Es gibt zudem eine praktische Trennung zwischen Empfehlung und Experiment. Für eine Schätzung muss kein Modell heruntergeladen oder gestartet werden; zur Bestätigung der Leistung misst bench Tokens pro Sekunde und Zeit bis zum ersten Token gegen einen bereits laufenden Anbieter.

Wie es funktioniert

  1. Beim Start untersucht llmfit die lokale Hardware und die Laufzeitumgebungen; es berechnet Speichereignung, geschätzte Geschwindigkeit, Qualität und Kontext für jeden Katalogeintrag.
  2. Die Oberfläche zeigt sortierte Ergebnisse und erlaubt Suche, Download über einen Anbieter und Modelldetails. Der klassische Modus liefert Tabellen oder JSON für Skripte und Agenten.

Ultra-detaillierte Dark-Mode-Cyberpunk-Konzeptillustration einer Benutzeroberfläche: ein futuristisches Kommandozeilenfenster, das in einer dunklen Leere schwebt und neongrünen Text sowie strukturierte JSON-Datentabellen zeigt. Der Text leuchtet sanft und wirft eine neonfarbene Reflexion auf eine abstrakte metallische Oberfläche darunter, was den CLI-Modus und die JSON-Ausgabe für Automatisierung und Agenten darstellt.

  1. plan verwandelt eine angeforderte Konfiguration — Modell, Kontext, Quantisierung und Geschwindigkeitsziel — in Hardwareanforderungen und mögliche Ausführungspfade.
  2. bench verbindet sich mit einem laufenden Anbieter, speichert Durchläufe lokal und kann nach Bestätigung und GitHub-Authentifizierung einen Pull Request mit den Daten eröffnen.

Visuell reiche Dark-Mode-Cyberpunk-Szene, die ein futuristisches Benchmarking-Labor darstellt. Eine leuchtende CPU und GPU, eingeschlossen in transparentem Glas, sind durch Glasfaserkabel verbunden, die in neonorangenem und cyanfarbenem Licht pulsieren. Digitale Tachometer und Tokens-pro-Sekunde-Metriken schweben als holografische Anzeigen in der Luft und stellen den Befehl bench dar, der die lokale Modellleistung misst.

Die Codebasis ist ein Rust-Workspace mit llmfit-core für Erkennung und Analyse, llmfit-tui für die Oberfläche und llmfit-desktop für die Desktop-App; sie enthält zudem Python-Bindings und eine Weboberfläche.

Offizieller und halboffizieller Status

Es wurde kein Beleg für eine Aufnahme in einen offiziellen Marktplatz eines KI-Anbieters gefunden, ebenso wenig für eine Herstellerzertifizierung. Es gibt jedoch konkrete, vom Projekt dokumentierte Vertriebskanäle: eine Homebrew-Formel, MacPorts, Scoop, ein uv- oder pip-Paket, das Image ghcr.io/alexsjones/llmfit und ein crates.io-Paket.

Das bedeutet Verfügbarkeit über diese Kanäle, keine Kompatibilitätsgarantie oder formale Standard-Bezeichnung. Die über die API sichtbaren 31.374 Sterne und die von crates.io erfassten 2.344 aktuellen Downloads deuten auf beträchtliche Aufmerksamkeit hin, entsprechen aber nicht aktiven Installationen oder eindeutigen Nutzerinnen und Nutzern.

Das Ökosystem

Schwesterprojekte und Erweiterungen

Das README bezeichnet folgende als Schwesterprojekte:

  • sympozium-ai/sympozium: Agentenverwaltung auf Kubernetes, gemäß der vom Projekt erklärten Beziehung.
  • AlexsJones/llmserve: eine Oberfläche zur Auswahl eines Modells, einer Engine und zum Bereitstellen eines lokalen Modells; die GitHub-Suche ergab 338 Sterne.
  • AlexsJones/llama-panel: eine macOS-App zur Verwaltung lokaler llama-server-Instanzen; die Suche ergab 55 Sterne.

Ultra-detaillierte Cyberpunk-Digitallandschaft, die ein komplexes Netzwerk miteinander verbundener Neonknoten zeigt, das ein abstraktes neuronales Netzwerk bildet. Das Netzwerk ist in unterschiedliche leuchtende Cluster gegliedert, die verschiedene lokale Laufzeitumgebungen wie Ollama, llama.cpp, MLX und Docker darstellen. Der dunkle Hintergrund ist mit schwach vorbeiziehendem Code gefüllt.

Die Integration mit OpenClaw hat eine eigene Dokumentation im Repository-Baum, und die Kommandozeilenoberfläche stellt einen HTTP-Server mit Eignungsdaten und Modellauswahl für Cluster-Scheduler oder Aggregatoren bereit.

Forks, Übersetzungen und Derivate

Das README selbst bietet Übersetzungen ins Chinesische und Japanische (README.zh.md und README.ja.md). Das sind im Hauptrepository enthaltene Übersetzungen, keine separaten Ports.

Eine Abfrage der auffälligsten Forks ergab Kopien wie smirk-dev/llmfit und abdennour/llmfit, jeweils mit 6 Sternen und derselben Beschreibung wie das Original. Da keine Dokumentation gefunden wurde, die substanzielle Änderungen belegt, werden sie als Forks eingestuft, nicht als unabhängige Erweiterungen.

Das README nennt Pavelevich/llm-checker als Alternative: ein Node.js-Werkzeug mit Ollama-Integration, das Modelle direkt herunterlädt und testet, während llmfit anhand von Spezifikationen schätzt und MoE-Architekturen unterstützt.

Zahlen zum Repository

Erhoben: 13. August 2026; GitHub-API und crates.io.

MetrikWert
Sterne31.374
Forks1.928
Echte Abonnenten91
Auf der Seite sichtbare Commits1.075
Offene Issues laut API57
HauptspracheRust
LizenzMIT
Erstellt15. Februar 2026
Neuestes gefundenes Releasev1.1.9, 9. August 2026
Gesamt-Downloads auf crates.io16.677
Aktuelle Downloads auf crates.io2.344

Die von der API zurückgegebenen Top-Beitragenden waren AlexsJones (631 Beiträge), dependabot[bot] (74), three-foxes-in-a-trenchcoat (44) und github-actions[bot] (29). Die API liefert open_issues_count, ein Feld, das offene Pull Requests einschließen kann; es entspricht daher nicht zwingend einer reinen Issue-Zahl. Ebenso spiegelt watchers_count in der allgemeinen GitHub-API-Antwort die Sterne; subscribers_count wird hier als tatsächliche Abonnentenzahl angegeben.

Wie man beiträgt

Der Leitfaden verlangt stabiles Rust mit Edition 2024 und MSRV 1.85 oder neuer, Python 3 für Skripte der Modelldatenbank sowie Git. Der Beitragsablauf ist: das Repository forken, von main abzweigen, Änderungen vornehmen, cargo fmt, make clippy und make test ausführen und einen klaren, auf eine Korrektur oder Funktion fokussierten Pull Request eröffnen.

Um ein Modell hinzuzufügen, verlangt der Leitfaden, dessen Hugging-Face-Kennung zu TARGET_MODELS in scripts/scrape_hf_models.py hinzuzufügen, make update-models auszuführen, mit ./target/release/llmfit list zu validieren, gegebenenfalls MODELS.md zu aktualisieren und den Pull Request zu eröffnen.

Auffällige Dark-Mode-Cyberpunk-Illustration eines futuristischen Entwickler-Arbeitsplatzes. Mehrere holografische Terminalfenster schweben in der Luft und zeigen Rust-Programmcode und GitHub-Pull-Request-Diffs. Neongrüne und violette Akzente heben die Syntax hervor, während ein leuchtendes Rust-Zahnradlogo dezent in den Hintergrund integriert ist.

Wie die Community reagierte

Die auffindbaren direkten Belege auf Hacker News sind begrenzt. Die Ankündigung der Autorin bzw. des Autors im Thread 47045434 erhielt 1 Punkt und keine Kommentare, enthält also kein überprüfbares Lob oder Kritik von Dritten.

Der HN-Index förderte außerdem eine spätere Erwähnung von clmnt zutage: Sie stellten hf-agents vor und gaben an, llmfit zu nutzen, um Hardware zu profilieren und vor dem Start von Pi Agent ein Modell und eine Quantisierung auszuwählen. Die verfügbare Recherche lieferte weder die Zahlen noch den übergeordneten Thread dieser Erwähnung; es handelt sich um eine Aussage der Autorin bzw. des Autors eines anderen Projekts, keine unabhängige Bewertung.

Als operatives Signal enthalten die offenen Issues eine Bitte, Benchmarks zu teilen (Issue 867) und eine Anfrage zum Teilen von Ergebnissen (Issue 862), während die Dokumentation erklärt, dass Ergebnisse zunächst lokal gespeichert werden, bevor sie veröffentlicht werden. Das zeigt Interesse am Messablauf, kein Qualitätsurteil der Autorinnen und Autoren.

Abfragen zu Reddit, X, Product Hunt, Video, Drittanbieter-Blogs und Podcasts ergaben bei dieser Recherche keine auffindbaren und überprüfbaren Belege. Deshalb werden diesen Plattformen keine Meinungen, Launches oder Zahlen zugeschrieben.

llmfit im Vergleich zu anderen Ansätzen

AnsatzÜberprüfbare ÜberschneidungÜberprüfbarer Unterschied
Pavelevich/llm-checkerBeide helfen bei der Arbeit mit lokalen Modellen und beziehen sich auf Ollama.Llmfits README beschreibt llm-checker als direktes Herunterladen und Testen von Modellen; llmfit kann anhand von Spezifikationen schätzen und berücksichtigt MoE.
Ollama, llama.cpp, MLX, Docker Model Runner und LM StudioDas sind Laufzeitumgebungen, die llmfit erkennt oder abfragt.Sie sind keine Eins-zu-eins-Ersatzlösungen: llmfit nutzt sie als Anbieter, um Modelle zu entdecken, bereitzustellen oder zu messen.
AlexsJones/llmserveBeide zielen auf lokale Modelle ab und haben eine interaktive Oberfläche.llmserve präsentiert sich als Modell- und Engine-Auswahl zur Bereitstellung; llmfit konzentriert sich auf Eignung, Empfehlungen und Hardwareplanung.

Schnelleinstieg

Installation und erster Start

Auf macOS oder Linux ist die empfohlene Binary-Installation brew install AlexsJones/llmfit/llmfit; unter Windows scoop install llmfit. Ebenfalls dokumentiert sind port install llmfit, uv tool install -U llmfit, uvx llmfit, das Container-Image und der Build mit cargo build --release.

Hochdetailliertes Dark-Mode-Cyberpunk-3D-Rendering eines futuristischen Werkzeugkastens. Schwebende holografische Symbole repräsentieren verschiedene Paketmanager (Homebrew, Scoop, Docker, pip), angeordnet in einem kreisförmigen Muster um einen zentralen, leuchtenden Neonkern, der einem KI-Chip ähnelt. Helle Datenströme verbinden die Symbole mit dem Kern.

Nach der Installation öffnet die Ausführung von llmfit die interaktive Oberfläche und zeigt erkannte Spezifikationen sowie geordnete Modelle. Für Diagnosen vor der Meldung eines Problems llmfit doctor verwenden; für ein nicht-interaktives Ergebnis llmfit fit oder llmfit recommend --json.

Gängige Arbeitsabläufe

  • Modelle für Programmieraufgaben auswählen: llmfit recommend --json --use-case coding --limit 3 liefert gefilterte Empfehlungen für die Automatisierung.
  • Einen Kandidaten prüfen: llmfit info "Mistral-7B" zeigt die Eignungsanalyse, die Grundlagen der Schätzung und Überprüfungsbefehle.
  • Einen Kauf oder Server planen: llmfit plan "Qwen/Qwen3-4B-MLX-4bit" --context 8192 --target-tps 25 --json berechnet Anforderungen und Ausführungsalternativen.
  • Messen und teilen: Mit einem aktiven Anbieter zeigt llmfit bench --all --share --dry-run die Daten als Vorschau; llmfit bench --all --share misst und bietet an, einen Pull Request zu eröffnen.

Wesentliche Konfiguration

  • --memory, --ram und --cpu-cores: überschreiben die Erkennung von VRAM, RAM oder Kernen für virtuelle Maschinen oder Simulationen.
  • --max-context: begrenzt den für die Speicherschätzung verwendeten Kontext; ohne diese Option kann OLLAMA_CONTEXT_LENGTH verwendet werden.
  • --force-runtime: erzwingt mlx, llamacpp oder vllm in der Analyse, wenn die automatische Auswahl nicht passt.
  • LLAMA_SERVER_HOST oder LLAMA_SERVER_PORT: ändern die llama.cpp-Erkennung für bench.
  • LLMFIT_BENCH_STORE: ändert den Speicherort ausstehender Messungen unter Linux.

Häufige Fallstricke und Lösungen

  • Falls die automatische Erkennung in einer virtuellen Maschine oder mit defektem nvidia-smi fehlschlägt, die Hardware-Overrides verwenden, zum Beispiel llmfit --memory=24G --ram=64G fit.
  • Ein Benchmark benötigt einen laufenden Anbieter; für llama.cpp zeigt der Leitfaden llama-server -m ~/.cache/llmfit/models/Qwen3.5-0.8B-Q8_0.gguf --port 8080 -ngl 99 und danach r in der Oberfläche, um installierte Modelle zu aktualisieren.
  • --share authentifiziert vor der Messung und schlägt frühzeitig fehl, wenn die Zugangsdaten fehlen oder abgelaufen sind. Den Geräte-Flow verwenden oder GITHUB_TOKEN bzw. GH_TOKEN setzen; --dry-run vermeidet Netzwerkzugriffe.
  • Das standardmäßige GGUF-Download-Verzeichnis ist ~/.cache/llmfit/models; es kann in den Download-Manager-Einstellungen der Oberfläche geändert werden.

Integrationen und Migration

llmfit kann JSON für Skripte und Agenten ausgeben oder llmfit serve --host 0.0.0.0 --port 8787 ausführen, um /health, /api/v1/system und Modellauswahl per HTTP für Cluster-Scheduler bereitzustellen. Für bereits auf Ollama, llama.cpp, MLX, Docker Model Runner oder LM Studio basierende Abläufe besteht das dokumentierte Muster darin, diesen Anbieter beizubehalten und llmfit ihn für Inventar oder Benchmarks erkennen zu lassen.

Anwendungsfälle

  • Wer Modelle lokal auf einem Laptop oder einer Workstation ausführen möchte, kann Speichereignung und eine geschätzte Geschwindigkeit vergleichen, bevor große Modelle heruntergeladen werden.
  • Teams, die mehrere GPUs, Apple Silicon oder uneinheitliche Hardware verwalten, können die Erkennung überschreiben und RAM, VRAM, Kerne und Kontext simulieren, um eine reproduzierbare Konfiguration zu planen.
  • Verantwortliche für Automatisierung oder Cluster-Planung können JSON oder die HTTP-API nutzen, um die auf jedem Knoten ausführbaren Modelle auszuwählen.
  • Wer lokale Anbieter betreut, kann Ollama, vLLM, MLX oder llama.cpp messen, die eigenen Daten zunächst lokal behalten und sie optional beitragen, damit identische Maschinen von einem späteren Release profitieren.

Ressourcen


Hinweis: Dieser Artikel kombiniert Dokumentation, den Beitragsleitfaden, die GitHub-API, crates.io und den Hacker-News-Index, abgerufen am 13. August 2026. Zahlen ändern sich mit der Zeit.

Kommentare