llmfit: elegir modelos locales según el hardware real
AlexsJones/llmfit · 37.154★ · 2.368 forks
Todo lo que hay que saber sobre AlexsJones/llmfit: una herramienta de terminal y una interfaz interactiva que detecta un equipo y ordena modelos locales por ajuste, velocidad estimada, calidad y contexto.
Qué es llmfit
llmfit ayuda a decidir qué modelo de lenguaje local puede ejecutarse bien en un equipo concreto. Detecta RAM, CPU, GPU, VRAM y proveedores instalados; después puntúa el catálogo por ajuste de memoria, velocidad, calidad y contexto. Ofrece una interfaz de terminal interactiva por defecto y un modo de línea de comandos para automatización.

El repositorio documenta compatibilidad con Ollama, llama.cpp, MLX, Docker Model Runner y LM Studio, además de configuraciones con varias GPU, arquitecturas MoE y selección dinámica de cuantización. No ejecuta necesariamente todos los candidatos para recomendarlos: sus estimaciones parten de las especificaciones y exponen sus supuestos mediante llmfit info; el banco de pruebas permite sustituir estimaciones por mediciones propias.

El origen: de justificar un portátil a catalogar el ajuste
Alex Jones creó el repositorio el 15 de febrero de 2026. Su perfil se presenta como ingeniero principal en AWS y describe su trabajo como infraestructura para la era de los agentes.

El lanzamiento recuperado en Hacker News, enviado por la cuenta axjns el 17 de febrero de 2026, da el contexto más directo: su autor escribió que lo construyó para justificar la compra de un portátil más potente. El envío, hilo 47045434, tenía 1 punto y 0 comentarios en el índice consultado; acredita la presentación inicial, no una recepción independiente.
Filosofía y principios
La propuesta privilegia decisiones verificables sobre una lista genérica de modelos: la herramienta muestra el ajuste y la base de las estimaciones, y orienta al usuario hacia una verificación en su propio equipo. El flujo comunitario continúa esa idea: una medición local se guarda primero y solo se comparte de forma opcional mediante una solicitud de cambios; las mediciones aceptadas pasan a futuras publicaciones para equipos idénticos.
También hay una separación práctica entre recomendación y experimentación. Para estimar no hace falta descargar ni arrancar cada modelo; para confirmar rendimiento, bench mide tokens por segundo y tiempo hasta el primer token contra un proveedor que ya está ejecutándose.
Cómo funciona
- Al iniciar, llmfit inspecciona el hardware y los entornos de ejecución locales; calcula ajuste de memoria, velocidad estimada, calidad y contexto para cada entrada del catálogo.
- La interfaz muestra los resultados ordenados y permite buscar, descargar mediante un proveedor y consultar detalles del modelo. El modo clásico devuelve tablas o JSON para guiones y agentes.

plantransforma una configuración solicitada —modelo, contexto, cuantización y objetivo de velocidad— en requisitos de hardware y rutas de ejecución posibles.benchconecta con un proveedor en marcha, conserva localmente las ejecuciones y puede abrir una solicitud de cambios con los datos, previa confirmación y autenticación de GitHub.

La base de código es un espacio de trabajo Rust con llmfit-core para detección y análisis, llmfit-tui para la interfaz, y llmfit-desktop para la aplicación de escritorio; también contiene enlaces Python y una interfaz web.
Estado oficial y semioficial
No se recuperó evidencia de aceptación en un mercado oficial de un proveedor de IA ni de una certificación de fabricante. Sí hay canales de distribución concretos documentados por el proyecto: fórmula de Homebrew, MacPorts, Scoop, paquete para uv o pip, imagen ghcr.io/alexsjones/llmfit y paquete de crates.io.
Esto implica disponibilidad por esos canales, no una garantía de compatibilidad ni una designación formal como estándar. Las 31.374 estrellas visibles en la API y las 2.344 descargas recientes registradas por crates.io sugieren atención considerable, pero no equivalen a instalaciones activas ni a usuarios únicos.
El ecosistema
Proyectos hermanos y extensiones
El README llama proyectos hermanos a los siguientes:
sympozium-ai/sympozium: gestión de agentes en Kubernetes, según la relación declarada por el proyecto.AlexsJones/llmserve: interfaz para elegir un modelo, un motor y servir un modelo local; la búsqueda de GitHub devolvió 338 estrellas.AlexsJones/llama-panel: aplicación macOS para administrar instancias locales dellama-server; la búsqueda devolvió 55 estrellas.

La integración con OpenClaw tiene documentación propia en el árbol del repositorio, y la interfaz de línea de comandos expone un servidor HTTP con datos de ajuste y selección de modelos para planificadores de clústeres o agregadores.
Bifurcaciones, traducciones y derivados
El propio README ofrece traducciones al chino y japonés (README.zh.md y README.ja.md). Son traducciones incluidas en el repositorio principal, no puertos separados.
La consulta de las bifurcaciones más destacadas devolvió copias como smirk-dev/llmfit y abdennour/llmfit, con 6 estrellas cada una y la misma descripción del original. Al no recuperar documentación que pruebe cambios sustantivos, se clasifican como bifurcaciones y no como extensiones independientes.
El README identifica Pavelevich/llm-checker como alternativa: es una herramienta Node.js con integración Ollama que descarga y prueba modelos directamente, mientras llmfit estima desde especificaciones y admite arquitecturas MoE.
Números del repo
Medición: 13 de agosto de 2026; API de GitHub y crates.io.
| Métrica | Valor |
|---|---|
| Estrellas | 31.374 |
| Bifurcaciones | 1.928 |
| Suscriptores reales | 91 |
| Commits visibles en la página | 1.075 |
| Incidencias abiertas indicadas por API | 57 |
| Lenguaje principal | Rust |
| Licencia | MIT |
| Creación | 15 de febrero de 2026 |
| Última publicación recuperada | v1.1.9, 9 de agosto de 2026 |
| Descargas totales en crates.io | 16.677 |
| Descargas recientes en crates.io | 2.344 |
Los principales contribuidores devueltos por la API fueron AlexsJones (631 contribuciones), dependabot[bot] (74), three-foxes-in-a-trenchcoat (44) y github-actions[bot] (29). La API devuelve open_issues_count, un campo que puede incluir solicitudes de cambios abiertas; por eso no equivale necesariamente al número exclusivo de incidencias. Además, watchers_count replica las estrellas en la respuesta general de GitHub: se informa subscribers_count como suscriptores reales.
Cómo contribuir
La guía exige Rust estable con edición 2024 y MSRV 1.85 o posterior, Python 3 para guiones de base de datos de modelos y Git. El flujo de contribución es bifurcar el repositorio, crear rama desde main, modificar, ejecutar cargo fmt, make clippy y make test, y abrir una solicitud de cambios clara y centrada en una corrección o función.
Para añadir un modelo, la guía indica incorporar su identificador de Hugging Face a TARGET_MODELS en scripts/scrape_hf_models.py, ejecutar make update-models, validar con ./target/release/llmfit list, actualizar MODELS.md si procede y abrir la solicitud de cambios.

Cómo lo recibió la comunidad
La evidencia directa recuperable en Hacker News es limitada. El anuncio del autor en el hilo 47045434 obtuvo 1 punto y ningún comentario, por lo que no contiene elogios ni críticas de terceros verificables.
En el índice de HN apareció también una mención posterior de clmnt: presentó hf-agents y afirmó que usa llmfit para perfilar el hardware y seleccionar modelo y cuantización antes de lanzar Pi Agent. La recuperación disponible no aportó las cifras ni el hilo padre de esa mención; se trata de una declaración del autor de otro proyecto, no de una evaluación independiente.
Como señal operativa, las incidencias abiertas incluyen una petición de compartir bancos de pruebas (incidencia 867) y una consulta sobre compartir resultados (incidencia 862), mientras que la documentación explica que los resultados se guardan localmente antes de publicarse. Esto muestra interés en el flujo de medición, no un juicio de calidad por parte de sus autores.
Las consultas de Reddit, X, Product Hunt, video, blogs de terceros y podcasts no produjeron evidencia recuperable y verificable durante esta ejecución. Por ello no se atribuyen opiniones, lanzamientos ni cifras a esas plataformas.
llmfit frente a otras propuestas
| Propuesta | Coincidencia verificable | Diferencia verificable |
|---|---|---|
Pavelevich/llm-checker | Ambas ayudan a trabajar con modelos locales y se relacionan con Ollama. | El README de llmfit describe que llm-checker descarga y prueba modelos directamente; llmfit puede estimar desde especificaciones y contempla MoE. |
| Ollama, llama.cpp, MLX, Docker Model Runner y LM Studio | Son entornos de ejecución que llmfit detecta o consulta. | No son sustitutos uno a uno: llmfit los usa como proveedores para descubrir, servir o medir modelos. |
AlexsJones/llmserve | Ambos se dirigen a modelos locales y tienen interfaz interactiva. | llmserve se presenta como selección de modelo y motor para servirlo; llmfit se centra en ajuste, recomendaciones y planificación de hardware. |
Guía rápida de uso
Instalación y primer arranque
En macOS o Linux, la instalación binaria recomendada es brew install AlexsJones/llmfit/llmfit; en Windows, scoop install llmfit. También se documentan port install llmfit, uv tool install -U llmfit, uvx llmfit, la imagen de contenedor y la compilación con cargo build --release.

Tras instalarlo, ejecutar llmfit abre la interfaz interactiva y muestra las especificaciones detectadas y los modelos ordenados. Para diagnóstico antes de informar de un problema, usar llmfit doctor; para un resultado no interactivo, llmfit fit o llmfit recommend --json.
Flujos de trabajo habituales
- Elegir modelos para programación:
llmfit recommend --json --use-case coding --limit 3devuelve recomendaciones filtradas para automatización. - Comprobar un candidato:
llmfit info "Mistral-7B"muestra el análisis de ajuste, las bases de estimación y comandos de verificación. - Planificar una compra o un servidor:
llmfit plan "Qwen/Qwen3-4B-MLX-4bit" --context 8192 --target-tps 25 --jsoncalcula requisitos y alternativas de ejecución. - Medir y compartir: con un proveedor activo,
llmfit bench --all --share --dry-runprevisualiza los datos;llmfit bench --all --sharemide y propone abrir una solicitud de cambios.
Configuración esencial
--memory,--ramy--cpu-cores: reemplazan la detección de VRAM, RAM o núcleos para máquinas virtuales o simulaciones.--max-context: limita el contexto usado en la estimación de memoria; sin él puede usarOLLAMA_CONTEXT_LENGTH.--force-runtime: fuerzamlx,llamacppovllmen el análisis cuando no conviene la selección automática.LLAMA_SERVER_HOSToLLAMA_SERVER_PORT: cambian la detección de llama.cpp parabench.LLMFIT_BENCH_STORE: cambia la ubicación de las mediciones pendientes en Linux.
Trampas frecuentes y soluciones
- Si la detección automática falla en una máquina virtual o con
nvidia-smiaveriado, usar las anulaciones de hardware, por ejemplollmfit --memory=24G --ram=64G fit. - Un banco de pruebas necesita un proveedor en ejecución; para llama.cpp, la guía muestra
llama-server -m ~/.cache/llmfit/models/Qwen3.5-0.8B-Q8_0.gguf --port 8080 -ngl 99y despuésren la interfaz para refrescar los modelos instalados. --shareautentica antes de medir y falla pronto si falta o caducó la credencial. Usar el flujo de dispositivo o definirGITHUB_TOKENoGH_TOKEN;--dry-runevita tocar la red.- El directorio de descargas GGUF predeterminado es
~/.cache/llmfit/models; se puede cambiar desde la configuración del gestor de descargas de la interfaz.
Integraciones y migración
llmfit puede entregar JSON a guiones y agentes, o ejecutar llmfit serve --host 0.0.0.0 --port 8787 para exponer /health, /api/v1/system y selección de modelos vía HTTP a planificadores de clúster. Para flujos ya basados en Ollama, llama.cpp, MLX, Docker Model Runner o LM Studio, el patrón documentado es mantener ese proveedor y dejar que llmfit lo detecte para inventario o bancos de pruebas.
Casos de uso
- Quien quiera ejecutar modelos localmente en un portátil o estación de trabajo puede comparar el ajuste de memoria y una estimación de velocidad antes de descargar modelos grandes.
- Equipos que administran varias GPU, Apple Silicon o máquinas con hardware irregular pueden sobrescribir la detección y simular RAM, VRAM, núcleos y contexto para planificar una configuración reproducible.
- Responsables de automatización o planificación de clústeres pueden consumir JSON o la API HTTP para elegir los modelos ejecutables en cada nodo.
- Personas que mantienen proveedores locales pueden medir Ollama, vLLM, MLX o llama.cpp, conservar primero sus datos y contribuirlos opcionalmente para que equipos idénticos se beneficien en una publicación posterior.
Recursos
- Repositorio: https://github.com/AlexsJones/llmfit
- Documentación e instalación: https://github.com/AlexsJones/llmfit#install
- Guía de interfaz, bancos de pruebas y uso: https://github.com/AlexsJones/llmfit/tree/main/docs
- Paquete Rust: https://crates.io/crates/llmfit
- Proyecto hermano para servir modelos: https://github.com/AlexsJones/llmserve
- Conversación en Hacker News: https://news.ycombinator.com/item?id=47045434
- Comunidad: https://github.com/AlexsJones/llmfit/discussions
Nota: este artículo combina documentación, guía de contribución, API de GitHub, crates.io y el índice de Hacker News consultados el 13 de agosto de 2026. Las cifras cambian con el tiempo.
Comentarios