Grok 4.5 llega a Copilot con 500K de contexto y tres niveles de reasoning: dónde conviene usarlo
Por Devy · Categoría: AI Dev Tools — General
El 28 de julio GitHub empezó el rollout de Grok 4.5 —el último modelo de reasoning de xAI— dentro de GitHub Copilot. No anunciado para más adelante, no en waitlist: shipping, de forma gradual, al model picker de VS Code, Visual Studio, Copilot CLI, el Copilot cloud agent, la app de Copilot, JetBrains, Xcode y Eclipse, para Pro, Pro+, Max, Business y Enterprise.
“Gradual” es la palabra a retener, y es la primera de dos razones por las que hoy puedes buscar Grok 4.5 en tu dropdown y no encontrarlo. Ya vamos a la segunda, que es la más interesante de las dos. Pero primero: qué llegó realmente, y dónde vale la pena gastarle tokens.
Qué obtienes
Acá importan tres specs.
Una ventana de contexto de 500.000 tokens. Ese es el número de titular, y es real: la misma ventana que Grok 4.5 expone a través de la propia API de xAI. En la práctica significa que puedes tirarle una porción grande de un repositorio, un build log largo o un thread completo de incidente sin necesidad de chunkear.
Input de texto e imagen. Screenshots de una UI rota, un diagrama de arquitectura, la foto de un whiteboard: todo entra como input válido junto a tu prompt.
Tres niveles de reasoning effort: low, medium y high. Esta es la parte que cambia cómo trabajas, no solo cuánto te cabe. No estás eligiendo un modelo: estás eligiendo cuánto pensamiento vas a pagar en cada tarea.
Lo que GitHub realmente notó
El changelog contiene una observación que vale más que la hoja de specs. GitHub reporta que Grok 4.5 “rindió especialmente bien despachando tools en paralelo y tomando acción directa”, y que eso lo hizo efectivo para tareas de terminal en VS Code y Copilot CLI.
Es un claim angosto y específico, y es útil. Despachar tools en paralelo es exactamente el cuello de botella del trabajo agéntico en terminal: un agente que dispara git status, npm ls y un grep sobre el repo en un solo turno en vez de tres secuenciales cierra un loop de diagnóstico en una fracción del tiempo real. Si tu día incluye bastante “averiguar por qué se rompió el build” en la CLI, este es el perfil que quieres.
Ojo con el framing, igual: esta es la lectura cualitativa de GitHub sobre su propia plataforma, no un benchmark publicado. Tómalo como una pista fuerte sobre dónde apuntar el modelo, no como un resultado medido.
Cómo elegir el nivel de reasoning
No hay guía oficial sobre esto, así que acá va la heurística práctica que aplica a los modelos de reasoning en general:
- Low — trabajo mecánico donde la respuesta es mayormente retrieval o transformación. Renombrar a través de archivos, escribir un commit message, traducir una config de YAML a TOML, explicar qué hace una función.
- Medium — el default para trabajo real. Escribir un feature contra un codebase existente, debuggear algo con una reproducción clara, revisar un diff.
- High — resérvalo. Decisiones de arquitectura, un bug cuya causa genuinamente no logras localizar, cualquier cosa donde una respuesta equivocada te cuesta una hora de rework.
La razón para ser disciplinado con esto no es pureza. Es la factura, que es la sección que sigue.
Dos cosas que te van a hacer tropezar
Una: en Business y Enterprise, la policy viene apagada por default. GitHub shipea Grok 4.5 con su model policy deshabilitada, lo que significa que nadie en el plan de tu organización lo ve en el picker hasta que un administrador la habilite. Si estás en un asiento corporativo y Grok 4.5 no aparece en tu dropdown, es mucho más probable que sea esto que el rollout gradual todavía no te haya llegado. La solución es una conversación con quien administre tu org de Copilot, no esperar: el setting vive en las policies de Copilot de la organización.
Vale entender esto como un patrón más que como una molestia. Desde que Copilot se volvió un marketplace de modelos multi-vendor, la postura default de GitHub frente a modelos de terceros nuevos es opt-in, no opt-out: la organización decide hacia qué vendors fluyen su código y sus prompts. Ese es el default correcto desde el punto de vista de gobernanza, y es también la razón por la que “¿está disponible?” y “¿lo puedo usar?” ahora son dos preguntas distintas.
Dos: factura a provider list pricing bajo usage-based billing. Desde el 1 de junio de 2026, Copilot ya no cuenta premium requests: consume GitHub AI Credits, descontados según uso de tokens (input, output y cached) a las tarifas de API publicadas de cada modelo. Cada plan pago incluye créditos equivalentes a su precio: los $10/mes de Pro incluyen $10 de créditos, los $19/usuario de Business incluyen $19, los $39/usuario de Enterprise incluyen $39. Grok 4.5 se descuenta de ese pozo a las tarifas de lista de xAI, hoy alrededor de $2 por millón de tokens de input y $6 por millón de output.
Haz la aritmética una vez, porque aclara bastante. Una ventana de 500K llena hasta el borde es aproximadamente un dólar de input por request: una décima parte del total de créditos mensuales de un plan Pro, antes de que el modelo haya escrito una sola línea de vuelta. Y cuando los créditos se acaban, ya no hay fallback experience: los usuarios individuales compran más, y las organizaciones o permiten el overage a tarifas estándar o lo topean.
Nada de esto hace que Grok 4.5 sea caro para el estándar del mercado —$2/$6 está en el rango accesible para un modelo de reasoning frontier—. Pero sí significa que la ventana de 500K es una capacidad para gastar deliberadamente, no un default para llenar. Apúntala al problema que necesita el repositorio completo en contexto; no le entregues el repositorio completo para un rename.
Cómo probarlo en diez minutos
- Revisa el tier de tu plan. Pro, Pro+, Max, Business o Enterprise.
- Abre el model picker en VS Code o corre
copiloten la CLI y busca Grok 4.5. Si estás en Business o Enterprise y no aparece, es la policy: pídele a tu admin que la habilite en las model policies de Copilot de la organización. - Dale la tarea en la que reportadamente es bueno. Abre Copilot CLI en un repo con un build genuinamente roto y pídele que diagnostique la falla y proponga un fix. Observa si despacha varios comandos por turno: ese dispatch paralelo es el comportamiento que GitHub destacó, y se ve en el transcript.
- Corre la misma tarea con effort medium y con high, y compara. Vas a aprender más sobre dónde vale la pena pagar high con un A/B en tu propio codebase que con cualquier tabla de benchmarks.
- Revisa después tu consumo de créditos en la vista de billing, mientras la sesión todavía está fresca en tu memoria. Hacer esto una vez te calibra la intuición para el resto del mes.
Para llevarte
Grok 4.5 en Copilot no es un artefacto nuevo para instalar: es una entrada más en un picker que ya tiene varias. Lo que lo hace digno de diez minutos es un fit específico: una ventana de 500K más una fortaleza documentada en dispatch paralelo de tools lo vuelven buen candidato para trabajo agéntico de terminal en Copilot CLI, que es precisamente el workflow donde las tool calls secuenciales más duelen.
Lo que hace que valga leer la letra chica es que “disponible” ahora significa dos cosas distintas. En un plan personal, está cuando el rollout te alcanza. En un plan corporativo, está cuando alguien decide que debería estar, y factura a precio de lista contra un pozo de créditos que puedes drenar más rápido de lo que esperarías con 500K de contexto.
¿Y tú — ya lo probaste en Copilot CLI, o tu picker todavía no lo muestra? Si estás en un plan Business o Enterprise, cuéntanos si tuviste que pedirle al admin que habilite la policy.