23 de agosto de 2026 · Por YasKad
AlexsJones/llmfit

llmfit: elegir modelos locales según el hardware real

AlexsJones/llmfit · 37.154★ · 2.368 forks

Todo lo que hay que saber sobre AlexsJones/llmfit: una herramienta de terminal y una interfaz interactiva que detecta un equipo y ordena modelos locales por ajuste, velocidad estimada, calidad y contexto.


Qué es llmfit

llmfit ayuda a decidir qué modelo de lenguaje local puede ejecutarse bien en un equipo concreto. Detecta RAM, CPU, GPU, VRAM y proveedores instalados; después puntúa el catálogo por ajuste de memoria, velocidad, calidad y contexto. Ofrece una interfaz de terminal interactiva por defecto y un modo de línea de comandos para automatización.

Ilustración cyberpunk oscura y ultra detallada de una placa base de computadora brillante y delineada en neón. Módulos de RAM y una GPU masiva están iluminados en cian y magenta vibrantes, con flujos de datos holográficos escaneando los componentes de hardware, representando la fase de detección de hardware e inspección del sistema.

El repositorio documenta compatibilidad con Ollama, llama.cpp, MLX, Docker Model Runner y LM Studio, además de configuraciones con varias GPU, arquitecturas MoE y selección dinámica de cuantización. No ejecuta necesariamente todos los candidatos para recomendarlos: sus estimaciones parten de las especificaciones y exponen sus supuestos mediante llmfit info; el banco de pruebas permite sustituir estimaciones por mediciones propias.

Visualización ultra detallada en modo oscuro cyberpunk de un mercado de datos futurista. Contenedores holográficos abstractos etiquetados con distintos nombres de modelos de IA están siendo ordenados y escaneados por brazos robóticos que emiten haces láser neón, con los modelos clasificados en un tablero de clasificación neón brillante.

El origen: de justificar un portátil a catalogar el ajuste

Alex Jones creó el repositorio el 15 de febrero de 2026. Su perfil se presenta como ingeniero principal en AWS y describe su trabajo como infraestructura para la era de los agentes.

Render 3D ultra detallado inspirado en cyberpunk de una laptop elegante que emite una masiva red neuronal holográfica brillante. El holograma forma una esfera perfecta de nodos neón interconectados, flotando sobre la pantalla de la laptop, bañada en luz neón azul y morado profundo, representando el origen de la herramienta: justificar la compra de una laptop potente para ejecutar modelos de IA locales.

El lanzamiento recuperado en Hacker News, enviado por la cuenta axjns el 17 de febrero de 2026, da el contexto más directo: su autor escribió que lo construyó para justificar la compra de un portátil más potente. El envío, hilo 47045434, tenía 1 punto y 0 comentarios en el índice consultado; acredita la presentación inicial, no una recepción independiente.

Filosofía y principios

La propuesta privilegia decisiones verificables sobre una lista genérica de modelos: la herramienta muestra el ajuste y la base de las estimaciones, y orienta al usuario hacia una verificación en su propio equipo. El flujo comunitario continúa esa idea: una medición local se guarda primero y solo se comparte de forma opcional mediante una solicitud de cambios; las mediciones aceptadas pasan a futuras publicaciones para equipos idénticos.

También hay una separación práctica entre recomendación y experimentación. Para estimar no hace falta descargar ni arrancar cada modelo; para confirmar rendimiento, bench mide tokens por segundo y tiempo hasta el primer token contra un proveedor que ya está ejecutándose.

Cómo funciona

  1. Al iniciar, llmfit inspecciona el hardware y los entornos de ejecución locales; calcula ajuste de memoria, velocidad estimada, calidad y contexto para cada entrada del catálogo.
  2. La interfaz muestra los resultados ordenados y permite buscar, descargar mediante un proveedor y consultar detalles del modelo. El modo clásico devuelve tablas o JSON para guiones y agentes.

Ilustración conceptual de UI cyberpunk en modo oscuro y ultra detallada: una ventana de terminal de línea de comandos futurista flotando en un vacío oscuro, mostrando texto verde neón y tablas de datos JSON estructuradas. El texto brilla suavemente, proyectando un reflejo neón sobre una superficie metálica abstracta debajo, representando el modo CLI y la salida JSON para automatización y agentes.

  1. plan transforma una configuración solicitada —modelo, contexto, cuantización y objetivo de velocidad— en requisitos de hardware y rutas de ejecución posibles.
  2. bench conecta con un proveedor en marcha, conserva localmente las ejecuciones y puede abrir una solicitud de cambios con los datos, previa confirmación y autenticación de GitHub.

Escena visualmente rica en modo oscuro cyberpunk que representa un laboratorio futurista de benchmarking. Una CPU y GPU brillantes encerradas en vidrio transparente están conectadas por cables de fibra óptica pulsando con luz neón naranja y cian. Velocímetros digitales y métricas de tokens por segundo flotan en el aire como pantallas holográficas, representando el comando bench, midiendo el rendimiento local del modelo.

La base de código es un espacio de trabajo Rust con llmfit-core para detección y análisis, llmfit-tui para la interfaz, y llmfit-desktop para la aplicación de escritorio; también contiene enlaces Python y una interfaz web.

Estado oficial y semioficial

No se recuperó evidencia de aceptación en un mercado oficial de un proveedor de IA ni de una certificación de fabricante. Sí hay canales de distribución concretos documentados por el proyecto: fórmula de Homebrew, MacPorts, Scoop, paquete para uv o pip, imagen ghcr.io/alexsjones/llmfit y paquete de crates.io.

Esto implica disponibilidad por esos canales, no una garantía de compatibilidad ni una designación formal como estándar. Las 31.374 estrellas visibles en la API y las 2.344 descargas recientes registradas por crates.io sugieren atención considerable, pero no equivalen a instalaciones activas ni a usuarios únicos.

El ecosistema

Proyectos hermanos y extensiones

El README llama proyectos hermanos a los siguientes:

  • sympozium-ai/sympozium: gestión de agentes en Kubernetes, según la relación declarada por el proyecto.
  • AlexsJones/llmserve: interfaz para elegir un modelo, un motor y servir un modelo local; la búsqueda de GitHub devolvió 338 estrellas.
  • AlexsJones/llama-panel: aplicación macOS para administrar instancias locales de llama-server; la búsqueda devolvió 55 estrellas.

Paisaje digital cyberpunk ultra detallado que muestra una compleja red de nodos neón interconectados formando una red neuronal abstracta. La red está organizada en clústeres brillantes distintos, representando diferentes entornos de ejecución local como Ollama, llama.cpp, MLX y Docker. El fondo oscuro está lleno de código desplazándose tenuemente.

La integración con OpenClaw tiene documentación propia en el árbol del repositorio, y la interfaz de línea de comandos expone un servidor HTTP con datos de ajuste y selección de modelos para planificadores de clústeres o agregadores.

Bifurcaciones, traducciones y derivados

El propio README ofrece traducciones al chino y japonés (README.zh.md y README.ja.md). Son traducciones incluidas en el repositorio principal, no puertos separados.

La consulta de las bifurcaciones más destacadas devolvió copias como smirk-dev/llmfit y abdennour/llmfit, con 6 estrellas cada una y la misma descripción del original. Al no recuperar documentación que pruebe cambios sustantivos, se clasifican como bifurcaciones y no como extensiones independientes.

El README identifica Pavelevich/llm-checker como alternativa: es una herramienta Node.js con integración Ollama que descarga y prueba modelos directamente, mientras llmfit estima desde especificaciones y admite arquitecturas MoE.

Números del repo

Medición: 13 de agosto de 2026; API de GitHub y crates.io.

MétricaValor
Estrellas31.374
Bifurcaciones1.928
Suscriptores reales91
Commits visibles en la página1.075
Incidencias abiertas indicadas por API57
Lenguaje principalRust
LicenciaMIT
Creación15 de febrero de 2026
Última publicación recuperadav1.1.9, 9 de agosto de 2026
Descargas totales en crates.io16.677
Descargas recientes en crates.io2.344

Los principales contribuidores devueltos por la API fueron AlexsJones (631 contribuciones), dependabot[bot] (74), three-foxes-in-a-trenchcoat (44) y github-actions[bot] (29). La API devuelve open_issues_count, un campo que puede incluir solicitudes de cambios abiertas; por eso no equivale necesariamente al número exclusivo de incidencias. Además, watchers_count replica las estrellas en la respuesta general de GitHub: se informa subscribers_count como suscriptores reales.

Cómo contribuir

La guía exige Rust estable con edición 2024 y MSRV 1.85 o posterior, Python 3 para guiones de base de datos de modelos y Git. El flujo de contribución es bifurcar el repositorio, crear rama desde main, modificar, ejecutar cargo fmt, make clippy y make test, y abrir una solicitud de cambios clara y centrada en una corrección o función.

Para añadir un modelo, la guía indica incorporar su identificador de Hugging Face a TARGET_MODELS en scripts/scrape_hf_models.py, ejecutar make update-models, validar con ./target/release/llmfit list, actualizar MODELS.md si procede y abrir la solicitud de cambios.

Ilustración cyberpunk llamativa en modo oscuro de un espacio de trabajo futurista de desarrollador. Múltiples ventanas de terminal holográficas flotan en el aire, mostrando código de programación Rust y diferencias de pull requests de GitHub. Acentos neón verdes y morados resaltan la sintaxis, mientras un logo de engranaje Rust brillante se integra sutilmente en el fondo.

Cómo lo recibió la comunidad

La evidencia directa recuperable en Hacker News es limitada. El anuncio del autor en el hilo 47045434 obtuvo 1 punto y ningún comentario, por lo que no contiene elogios ni críticas de terceros verificables.

En el índice de HN apareció también una mención posterior de clmnt: presentó hf-agents y afirmó que usa llmfit para perfilar el hardware y seleccionar modelo y cuantización antes de lanzar Pi Agent. La recuperación disponible no aportó las cifras ni el hilo padre de esa mención; se trata de una declaración del autor de otro proyecto, no de una evaluación independiente.

Como señal operativa, las incidencias abiertas incluyen una petición de compartir bancos de pruebas (incidencia 867) y una consulta sobre compartir resultados (incidencia 862), mientras que la documentación explica que los resultados se guardan localmente antes de publicarse. Esto muestra interés en el flujo de medición, no un juicio de calidad por parte de sus autores.

Las consultas de Reddit, X, Product Hunt, video, blogs de terceros y podcasts no produjeron evidencia recuperable y verificable durante esta ejecución. Por ello no se atribuyen opiniones, lanzamientos ni cifras a esas plataformas.

llmfit frente a otras propuestas

PropuestaCoincidencia verificableDiferencia verificable
Pavelevich/llm-checkerAmbas ayudan a trabajar con modelos locales y se relacionan con Ollama.El README de llmfit describe que llm-checker descarga y prueba modelos directamente; llmfit puede estimar desde especificaciones y contempla MoE.
Ollama, llama.cpp, MLX, Docker Model Runner y LM StudioSon entornos de ejecución que llmfit detecta o consulta.No son sustitutos uno a uno: llmfit los usa como proveedores para descubrir, servir o medir modelos.
AlexsJones/llmserveAmbos se dirigen a modelos locales y tienen interfaz interactiva.llmserve se presenta como selección de modelo y motor para servirlo; llmfit se centra en ajuste, recomendaciones y planificación de hardware.

Guía rápida de uso

Instalación y primer arranque

En macOS o Linux, la instalación binaria recomendada es brew install AlexsJones/llmfit/llmfit; en Windows, scoop install llmfit. También se documentan port install llmfit, uv tool install -U llmfit, uvx llmfit, la imagen de contenedor y la compilación con cargo build --release.

Render 3D cyberpunk en modo oscuro altamente detallado de un kit de herramientas futurista. Iconos holográficos flotantes representan diferentes gestores de paquetes (Homebrew, Scoop, Docker, pip) dispuestos en un patrón circular alrededor de un núcleo central brillante en neón que se asemeja a un chip de IA. Flujos de datos brillantes conectan los iconos con el núcleo.

Tras instalarlo, ejecutar llmfit abre la interfaz interactiva y muestra las especificaciones detectadas y los modelos ordenados. Para diagnóstico antes de informar de un problema, usar llmfit doctor; para un resultado no interactivo, llmfit fit o llmfit recommend --json.

Flujos de trabajo habituales

  • Elegir modelos para programación: llmfit recommend --json --use-case coding --limit 3 devuelve recomendaciones filtradas para automatización.
  • Comprobar un candidato: llmfit info "Mistral-7B" muestra el análisis de ajuste, las bases de estimación y comandos de verificación.
  • Planificar una compra o un servidor: llmfit plan "Qwen/Qwen3-4B-MLX-4bit" --context 8192 --target-tps 25 --json calcula requisitos y alternativas de ejecución.
  • Medir y compartir: con un proveedor activo, llmfit bench --all --share --dry-run previsualiza los datos; llmfit bench --all --share mide y propone abrir una solicitud de cambios.

Configuración esencial

  • --memory, --ram y --cpu-cores: reemplazan la detección de VRAM, RAM o núcleos para máquinas virtuales o simulaciones.
  • --max-context: limita el contexto usado en la estimación de memoria; sin él puede usar OLLAMA_CONTEXT_LENGTH.
  • --force-runtime: fuerza mlx, llamacpp o vllm en el análisis cuando no conviene la selección automática.
  • LLAMA_SERVER_HOST o LLAMA_SERVER_PORT: cambian la detección de llama.cpp para bench.
  • LLMFIT_BENCH_STORE: cambia la ubicación de las mediciones pendientes en Linux.

Trampas frecuentes y soluciones

  • Si la detección automática falla en una máquina virtual o con nvidia-smi averiado, usar las anulaciones de hardware, por ejemplo llmfit --memory=24G --ram=64G fit.
  • Un banco de pruebas necesita un proveedor en ejecución; para llama.cpp, la guía muestra llama-server -m ~/.cache/llmfit/models/Qwen3.5-0.8B-Q8_0.gguf --port 8080 -ngl 99 y después r en la interfaz para refrescar los modelos instalados.
  • --share autentica antes de medir y falla pronto si falta o caducó la credencial. Usar el flujo de dispositivo o definir GITHUB_TOKEN o GH_TOKEN; --dry-run evita tocar la red.
  • El directorio de descargas GGUF predeterminado es ~/.cache/llmfit/models; se puede cambiar desde la configuración del gestor de descargas de la interfaz.

Integraciones y migración

llmfit puede entregar JSON a guiones y agentes, o ejecutar llmfit serve --host 0.0.0.0 --port 8787 para exponer /health, /api/v1/system y selección de modelos vía HTTP a planificadores de clúster. Para flujos ya basados en Ollama, llama.cpp, MLX, Docker Model Runner o LM Studio, el patrón documentado es mantener ese proveedor y dejar que llmfit lo detecte para inventario o bancos de pruebas.

Casos de uso

  • Quien quiera ejecutar modelos localmente en un portátil o estación de trabajo puede comparar el ajuste de memoria y una estimación de velocidad antes de descargar modelos grandes.
  • Equipos que administran varias GPU, Apple Silicon o máquinas con hardware irregular pueden sobrescribir la detección y simular RAM, VRAM, núcleos y contexto para planificar una configuración reproducible.
  • Responsables de automatización o planificación de clústeres pueden consumir JSON o la API HTTP para elegir los modelos ejecutables en cada nodo.
  • Personas que mantienen proveedores locales pueden medir Ollama, vLLM, MLX o llama.cpp, conservar primero sus datos y contribuirlos opcionalmente para que equipos idénticos se beneficien en una publicación posterior.

Recursos


Nota: este artículo combina documentación, guía de contribución, API de GitHub, crates.io y el índice de Hacker News consultados el 13 de agosto de 2026. Las cifras cambian con el tiempo.

Comentarios