inference
| Tema | Respuestas | Vistas | Actividad | |
|---|---|---|---|---|
| Separar Attention de FFN: el plugin que le saca 11% más throughput a vLLM sin tocarle una línea |
|
0 | 12 | 27 Julio 2026 |
| Colibrì: Cómo Corre un Modelo de 744B Parámetros en una Laptop de 32GB (Sin GPU, Sin BLAS) |
|
0 | 51 | 12 Julio 2026 |
| Dejá de Pagar por Token: Serví Modelos Open Source en tu Hardware con vLLM |
|
0 | 37 | 24 Junio 2026 |