llmfit: lokale Modelle anhand der echten Hardware auswählen
AlexsJones/llmfit · 37.154★ · 2.368 forks
Alles Wissenswerte über AlexsJones/llmfit: ein Terminal-Werkzeug und eine interaktive Oberfläche, die eine Maschine erkennt und lokale Modelle nach Eignung, geschätzter Geschwindigkeit, Qualität und Kontext ordnet.
Was llmfit ist
llmfit hilft zu entscheiden, welches lokale Sprachmodell auf einer bestimmten Maschine gut laufen kann. Es erkennt RAM, CPU, GPU, VRAM und installierte Anbieter; anschließend bewertet es den Katalog nach Speichereignung, Geschwindigkeit, Qualität und Kontext. Standardmäßig bietet es eine interaktive Terminaloberfläche und einen Kommandozeilenmodus für Automatisierung.

Das Repository dokumentiert Kompatibilität mit Ollama, llama.cpp, MLX, Docker Model Runner und LM Studio sowie Multi-GPU-Konfigurationen, MoE-Architekturen und dynamische Quantisierungsauswahl. Es führt nicht zwingend jeden Kandidaten aus, um ihn zu empfehlen: Seine Schätzungen gehen von Spezifikationen aus und legen ihre Annahmen über llmfit info offen; die Benchmark-Suite erlaubt es, Schätzungen durch eigene Messungen zu ersetzen.

Der Ursprung: von der Rechtfertigung eines Laptops zur Katalogisierung der Eignung
Alex Jones erstellte das Repository am 15. Februar 2026. Ihr Profil beschreibt sie als Principal Engineer bei AWS, ihre Arbeit als Infrastruktur für das Zeitalter der Agenten.

Der auf Hacker News gefundene Launch, eingereicht vom Konto axjns am 17. Februar 2026, liefert den direktesten Kontext: Die Autorin bzw. der Autor schrieb, das Tool sei gebaut worden, um den Kauf eines leistungsstärkeren Laptops zu rechtfertigen. Die Einreichung, Thread 47045434, hatte im konsultierten Index 1 Punkt und 0 Kommentare; sie belegt die anfängliche Vorstellung, keine unabhängige Rezeption.
Philosophie und Prinzipien
Der Ansatz bevorzugt überprüfbare Entscheidungen gegenüber einer generischen Modellliste: Das Werkzeug zeigt die Eignung und die Grundlage seiner Schätzungen und weist die Nutzerin bzw. den Nutzer darauf hin, dies auf der eigenen Maschine zu verifizieren. Der Community-Ablauf setzt diese Idee fort: Eine lokale Messung wird zuerst gespeichert und nur optional über einen Pull Request geteilt; akzeptierte Messungen fließen in zukünftige Releases für identische Maschinen ein.
Es gibt zudem eine praktische Trennung zwischen Empfehlung und Experiment. Für eine Schätzung muss kein Modell heruntergeladen oder gestartet werden; zur Bestätigung der Leistung misst bench Tokens pro Sekunde und Zeit bis zum ersten Token gegen einen bereits laufenden Anbieter.
Wie es funktioniert
- Beim Start untersucht llmfit die lokale Hardware und die Laufzeitumgebungen; es berechnet Speichereignung, geschätzte Geschwindigkeit, Qualität und Kontext für jeden Katalogeintrag.
- Die Oberfläche zeigt sortierte Ergebnisse und erlaubt Suche, Download über einen Anbieter und Modelldetails. Der klassische Modus liefert Tabellen oder JSON für Skripte und Agenten.

planverwandelt eine angeforderte Konfiguration — Modell, Kontext, Quantisierung und Geschwindigkeitsziel — in Hardwareanforderungen und mögliche Ausführungspfade.benchverbindet sich mit einem laufenden Anbieter, speichert Durchläufe lokal und kann nach Bestätigung und GitHub-Authentifizierung einen Pull Request mit den Daten eröffnen.

Die Codebasis ist ein Rust-Workspace mit llmfit-core für Erkennung und Analyse, llmfit-tui für die Oberfläche und llmfit-desktop für die Desktop-App; sie enthält zudem Python-Bindings und eine Weboberfläche.
Offizieller und halboffizieller Status
Es wurde kein Beleg für eine Aufnahme in einen offiziellen Marktplatz eines KI-Anbieters gefunden, ebenso wenig für eine Herstellerzertifizierung. Es gibt jedoch konkrete, vom Projekt dokumentierte Vertriebskanäle: eine Homebrew-Formel, MacPorts, Scoop, ein uv- oder pip-Paket, das Image ghcr.io/alexsjones/llmfit und ein crates.io-Paket.
Das bedeutet Verfügbarkeit über diese Kanäle, keine Kompatibilitätsgarantie oder formale Standard-Bezeichnung. Die über die API sichtbaren 31.374 Sterne und die von crates.io erfassten 2.344 aktuellen Downloads deuten auf beträchtliche Aufmerksamkeit hin, entsprechen aber nicht aktiven Installationen oder eindeutigen Nutzerinnen und Nutzern.
Das Ökosystem
Schwesterprojekte und Erweiterungen
Das README bezeichnet folgende als Schwesterprojekte:
sympozium-ai/sympozium: Agentenverwaltung auf Kubernetes, gemäß der vom Projekt erklärten Beziehung.AlexsJones/llmserve: eine Oberfläche zur Auswahl eines Modells, einer Engine und zum Bereitstellen eines lokalen Modells; die GitHub-Suche ergab 338 Sterne.AlexsJones/llama-panel: eine macOS-App zur Verwaltung lokalerllama-server-Instanzen; die Suche ergab 55 Sterne.

Die Integration mit OpenClaw hat eine eigene Dokumentation im Repository-Baum, und die Kommandozeilenoberfläche stellt einen HTTP-Server mit Eignungsdaten und Modellauswahl für Cluster-Scheduler oder Aggregatoren bereit.
Forks, Übersetzungen und Derivate
Das README selbst bietet Übersetzungen ins Chinesische und Japanische (README.zh.md und README.ja.md). Das sind im Hauptrepository enthaltene Übersetzungen, keine separaten Ports.
Eine Abfrage der auffälligsten Forks ergab Kopien wie smirk-dev/llmfit und abdennour/llmfit, jeweils mit 6 Sternen und derselben Beschreibung wie das Original. Da keine Dokumentation gefunden wurde, die substanzielle Änderungen belegt, werden sie als Forks eingestuft, nicht als unabhängige Erweiterungen.
Das README nennt Pavelevich/llm-checker als Alternative: ein Node.js-Werkzeug mit Ollama-Integration, das Modelle direkt herunterlädt und testet, während llmfit anhand von Spezifikationen schätzt und MoE-Architekturen unterstützt.
Zahlen zum Repository
Erhoben: 13. August 2026; GitHub-API und crates.io.
| Metrik | Wert |
|---|---|
| Sterne | 31.374 |
| Forks | 1.928 |
| Echte Abonnenten | 91 |
| Auf der Seite sichtbare Commits | 1.075 |
| Offene Issues laut API | 57 |
| Hauptsprache | Rust |
| Lizenz | MIT |
| Erstellt | 15. Februar 2026 |
| Neuestes gefundenes Release | v1.1.9, 9. August 2026 |
| Gesamt-Downloads auf crates.io | 16.677 |
| Aktuelle Downloads auf crates.io | 2.344 |
Die von der API zurückgegebenen Top-Beitragenden waren AlexsJones (631 Beiträge), dependabot[bot] (74), three-foxes-in-a-trenchcoat (44) und github-actions[bot] (29). Die API liefert open_issues_count, ein Feld, das offene Pull Requests einschließen kann; es entspricht daher nicht zwingend einer reinen Issue-Zahl. Ebenso spiegelt watchers_count in der allgemeinen GitHub-API-Antwort die Sterne; subscribers_count wird hier als tatsächliche Abonnentenzahl angegeben.
Wie man beiträgt
Der Leitfaden verlangt stabiles Rust mit Edition 2024 und MSRV 1.85 oder neuer, Python 3 für Skripte der Modelldatenbank sowie Git. Der Beitragsablauf ist: das Repository forken, von main abzweigen, Änderungen vornehmen, cargo fmt, make clippy und make test ausführen und einen klaren, auf eine Korrektur oder Funktion fokussierten Pull Request eröffnen.
Um ein Modell hinzuzufügen, verlangt der Leitfaden, dessen Hugging-Face-Kennung zu TARGET_MODELS in scripts/scrape_hf_models.py hinzuzufügen, make update-models auszuführen, mit ./target/release/llmfit list zu validieren, gegebenenfalls MODELS.md zu aktualisieren und den Pull Request zu eröffnen.

Wie die Community reagierte
Die auffindbaren direkten Belege auf Hacker News sind begrenzt. Die Ankündigung der Autorin bzw. des Autors im Thread 47045434 erhielt 1 Punkt und keine Kommentare, enthält also kein überprüfbares Lob oder Kritik von Dritten.
Der HN-Index förderte außerdem eine spätere Erwähnung von clmnt zutage: Sie stellten hf-agents vor und gaben an, llmfit zu nutzen, um Hardware zu profilieren und vor dem Start von Pi Agent ein Modell und eine Quantisierung auszuwählen. Die verfügbare Recherche lieferte weder die Zahlen noch den übergeordneten Thread dieser Erwähnung; es handelt sich um eine Aussage der Autorin bzw. des Autors eines anderen Projekts, keine unabhängige Bewertung.
Als operatives Signal enthalten die offenen Issues eine Bitte, Benchmarks zu teilen (Issue 867) und eine Anfrage zum Teilen von Ergebnissen (Issue 862), während die Dokumentation erklärt, dass Ergebnisse zunächst lokal gespeichert werden, bevor sie veröffentlicht werden. Das zeigt Interesse am Messablauf, kein Qualitätsurteil der Autorinnen und Autoren.
Abfragen zu Reddit, X, Product Hunt, Video, Drittanbieter-Blogs und Podcasts ergaben bei dieser Recherche keine auffindbaren und überprüfbaren Belege. Deshalb werden diesen Plattformen keine Meinungen, Launches oder Zahlen zugeschrieben.
llmfit im Vergleich zu anderen Ansätzen
| Ansatz | Überprüfbare Überschneidung | Überprüfbarer Unterschied |
|---|---|---|
Pavelevich/llm-checker | Beide helfen bei der Arbeit mit lokalen Modellen und beziehen sich auf Ollama. | Llmfits README beschreibt llm-checker als direktes Herunterladen und Testen von Modellen; llmfit kann anhand von Spezifikationen schätzen und berücksichtigt MoE. |
| Ollama, llama.cpp, MLX, Docker Model Runner und LM Studio | Das sind Laufzeitumgebungen, die llmfit erkennt oder abfragt. | Sie sind keine Eins-zu-eins-Ersatzlösungen: llmfit nutzt sie als Anbieter, um Modelle zu entdecken, bereitzustellen oder zu messen. |
AlexsJones/llmserve | Beide zielen auf lokale Modelle ab und haben eine interaktive Oberfläche. | llmserve präsentiert sich als Modell- und Engine-Auswahl zur Bereitstellung; llmfit konzentriert sich auf Eignung, Empfehlungen und Hardwareplanung. |
Schnelleinstieg
Installation und erster Start
Auf macOS oder Linux ist die empfohlene Binary-Installation brew install AlexsJones/llmfit/llmfit; unter Windows scoop install llmfit. Ebenfalls dokumentiert sind port install llmfit, uv tool install -U llmfit, uvx llmfit, das Container-Image und der Build mit cargo build --release.

Nach der Installation öffnet die Ausführung von llmfit die interaktive Oberfläche und zeigt erkannte Spezifikationen sowie geordnete Modelle. Für Diagnosen vor der Meldung eines Problems llmfit doctor verwenden; für ein nicht-interaktives Ergebnis llmfit fit oder llmfit recommend --json.
Gängige Arbeitsabläufe
- Modelle für Programmieraufgaben auswählen:
llmfit recommend --json --use-case coding --limit 3liefert gefilterte Empfehlungen für die Automatisierung. - Einen Kandidaten prüfen:
llmfit info "Mistral-7B"zeigt die Eignungsanalyse, die Grundlagen der Schätzung und Überprüfungsbefehle. - Einen Kauf oder Server planen:
llmfit plan "Qwen/Qwen3-4B-MLX-4bit" --context 8192 --target-tps 25 --jsonberechnet Anforderungen und Ausführungsalternativen. - Messen und teilen: Mit einem aktiven Anbieter zeigt
llmfit bench --all --share --dry-rundie Daten als Vorschau;llmfit bench --all --sharemisst und bietet an, einen Pull Request zu eröffnen.
Wesentliche Konfiguration
--memory,--ramund--cpu-cores: überschreiben die Erkennung von VRAM, RAM oder Kernen für virtuelle Maschinen oder Simulationen.--max-context: begrenzt den für die Speicherschätzung verwendeten Kontext; ohne diese Option kannOLLAMA_CONTEXT_LENGTHverwendet werden.--force-runtime: erzwingtmlx,llamacppodervllmin der Analyse, wenn die automatische Auswahl nicht passt.LLAMA_SERVER_HOSToderLLAMA_SERVER_PORT: ändern die llama.cpp-Erkennung fürbench.LLMFIT_BENCH_STORE: ändert den Speicherort ausstehender Messungen unter Linux.
Häufige Fallstricke und Lösungen
- Falls die automatische Erkennung in einer virtuellen Maschine oder mit defektem
nvidia-smifehlschlägt, die Hardware-Overrides verwenden, zum Beispielllmfit --memory=24G --ram=64G fit. - Ein Benchmark benötigt einen laufenden Anbieter; für llama.cpp zeigt der Leitfaden
llama-server -m ~/.cache/llmfit/models/Qwen3.5-0.8B-Q8_0.gguf --port 8080 -ngl 99und danachrin der Oberfläche, um installierte Modelle zu aktualisieren. --shareauthentifiziert vor der Messung und schlägt frühzeitig fehl, wenn die Zugangsdaten fehlen oder abgelaufen sind. Den Geräte-Flow verwenden oderGITHUB_TOKENbzw.GH_TOKENsetzen;--dry-runvermeidet Netzwerkzugriffe.- Das standardmäßige GGUF-Download-Verzeichnis ist
~/.cache/llmfit/models; es kann in den Download-Manager-Einstellungen der Oberfläche geändert werden.
Integrationen und Migration
llmfit kann JSON für Skripte und Agenten ausgeben oder llmfit serve --host 0.0.0.0 --port 8787 ausführen, um /health, /api/v1/system und Modellauswahl per HTTP für Cluster-Scheduler bereitzustellen. Für bereits auf Ollama, llama.cpp, MLX, Docker Model Runner oder LM Studio basierende Abläufe besteht das dokumentierte Muster darin, diesen Anbieter beizubehalten und llmfit ihn für Inventar oder Benchmarks erkennen zu lassen.
Anwendungsfälle
- Wer Modelle lokal auf einem Laptop oder einer Workstation ausführen möchte, kann Speichereignung und eine geschätzte Geschwindigkeit vergleichen, bevor große Modelle heruntergeladen werden.
- Teams, die mehrere GPUs, Apple Silicon oder uneinheitliche Hardware verwalten, können die Erkennung überschreiben und RAM, VRAM, Kerne und Kontext simulieren, um eine reproduzierbare Konfiguration zu planen.
- Verantwortliche für Automatisierung oder Cluster-Planung können JSON oder die HTTP-API nutzen, um die auf jedem Knoten ausführbaren Modelle auszuwählen.
- Wer lokale Anbieter betreut, kann Ollama, vLLM, MLX oder llama.cpp messen, die eigenen Daten zunächst lokal behalten und sie optional beitragen, damit identische Maschinen von einem späteren Release profitieren.
Ressourcen
- Repository: https://github.com/AlexsJones/llmfit
- Dokumentation und Installation: https://github.com/AlexsJones/llmfit#install
- Leitfaden zu Oberfläche, Benchmarks und Nutzung: https://github.com/AlexsJones/llmfit/tree/main/docs
- Rust-Paket: https://crates.io/crates/llmfit
- Schwesterprojekt zum Bereitstellen von Modellen: https://github.com/AlexsJones/llmserve
- Diskussion auf Hacker News: https://news.ycombinator.com/item?id=47045434
- Community: https://github.com/AlexsJones/llmfit/discussions
Hinweis: Dieser Artikel kombiniert Dokumentation, den Beitragsleitfaden, die GitHub-API, crates.io und den Hacker-News-Index, abgerufen am 13. August 2026. Zahlen ändern sich mit der Zeit.
Kommentare