English · Русский · 简体中文 · Español
September 18 update (English): Bonsai benchmarks · REAP / APEX rebuild · Jev API + browser-use · Updated graphics.
Modelos más grandes en el hardware que ya tienes. LocalForgeLLM es un framework con el que tu agente de programación construye y optimiza un entorno local de IA. Indica una tarea y, si quieres, un modelo MoE; el agente adapta el modelo, motor, cuantización y parámetros de inicio a tu hardware. El resultado sirve para chat local, visión y agentes de programación.
Tecnologías: agentes de programación con IA · documentación de modelos y motores · Python / Bash · motores de inferencia como llama.cpp · backends de CPU / GPU · API HTTP local.
Necesitas: un agente de programación con acceso al terminal y espacio para el modelo elegido. El agente selecciona las dependencias y los ajustes de memoria para tu equipo.
- Abre este repositorio en tu agente de programación y pídele que lea AGENTS.md y SKILL.md.
- Describe la tarea, el tamaño de contexto deseado y el presupuesto de RAM/VRAM. Indica un modelo o deja que el agente lo elija.
- Pídele que siga la documentación del framework para instalar el motor, ajustar el modelo y guardar un perfil de inicio funcional.
Como punto de partida concreto, consulta nuestros ejemplos de inicio de Qwen y Gemma.
El agente examina tu hardware y la documentación de los modelos, elige un modelo adecuado, un motor y un formato de pesos compatibles, y ajusta la distribución CPU/GPU, el contexto, la caché y los lotes. Ejecuta tu tarea, mide la velocidad y el uso de memoria, afina los parámetros y guarda el mejor perfil funcional. El mismo ciclo sirve para distintas familias MoE y métodos de cuantización.
Ryzen 5 5600 · 32 GB de RAM · 8 GB de VRAM · contexto de 32K · 10 de septiembre de 2026. Estos dos perfiles usan APEX GGUF + llama.cpp / Vulkan.
| Modelo / perfil | Generación | RAM | VRAM del modelo |
|---|---|---|---|
| Qwen3.6 35B-A3B · I-Compact | 21.11 tokens/s | pico de RSS de 13.43 GiB | 4.07 GiB |
| Gemma 4 26B-A4B Heretic · I-Balanced + visión | 9.78 tokens/s | límite del servicio de 11 GiB | lectura puntual de 4.88 GiB |
Qwen: 28 solicitudes, hasta 29,087 tokens de contexto. Gemma: una solicitud con visión habilitada. Las velocidades corresponden a la generación de tokens.
Nuestra velocidad de Qwen es 2.13× la velocidad en caliente publicada por Colibri y un 46.3% inferior a la publicada por FreeToken, en las configuraciones indicadas arriba. Un modelo de 35B funciona aquí con 13.43 GiB de RSS máximo y 4.07 GiB de VRAM del modelo. Ajustes, definiciones de las métricas y fuentes →
Actualización del 11 de septiembre: 14.83 tokens/s ponderados en dos solicitudes; la respuesta larga registró 1535 tokens en 102.05 s de generación, 15.03 tokens/s. El modelo principal sigue siendo Heretic APEX I-Balanced; Q8_0 corresponde al asistente MTP separado. Se conservaron la distribución de los pesos principales y la ventana de 32K.
La diferencia observada frente a la solicitud anterior sin MTP (9.81 tokens/s) es +51.1%, pero las solicitudes difieren: no es una ganancia causal aislada de MTP. El contexto máximo observado fue de 2265 tokens; la evaluación formal de calidad sigue pendiente. Resumen e infografías en inglés · Mediciones y fuentes · Descargar, activar y desactivar MTP
Skill del agente · Manual del framework · Documentación en español · Perfiles de inicio · Metodología de medición · Comparación detallada