Pesquisa

Apresentamos o Grok 4.6

4 min de leitura

Hoje lançamos o Grok 4.6 junto com a SpaceXAI.

O Grok 4.6 se baseia no Grok 4.5, com foco especial em agentes de longa duração e trabalhos interativos e visuais mais ambiciosos. Ele acompanha tarefas complexas em várias etapas, seja para pesquisar um tema, analisar informações, trabalhar em uma base de código ou transformar uma ideia em um app refinado ou artefato de trabalho.

O Grok 4.6 alcança inteligência de ponta em vários benchmarks de programação agêntica e trabalho do conhecimento. Ele se equipara ao GPT-5.6 Sol no Artificial Analysis Intelligence Index, que é uma pontuação composta de nove benchmarks.

Resultados de benchmark do Grok 4.6 em avaliações de programação e trabalho do conhecimento

O Grok 4.6 está disponível hoje no Cursor e no Grok Build. Estamos oferecendo o dobro do uso incluído no Cursor e no Grok Build durante a primeira semana.

Treinamento do Grok 4.6

O Grok 4.6 passou por um ciclo suplementar de treinamento mais longo que o do Grok 4.5, com dados selecionados e gerados pelo modelo para raciocínio e conceitos técnicos avançados, dados de engenharia de alta qualidade e um otimizador e uma receita de treinamento aprimorados. Isso resultou em uma base mais sólida para as etapas subsequentes de SFT e RL.

Em seguida, usamos o Grok 4.5 para regenerar as trajetórias de SFT em diferentes níveis de esforço de raciocínio, harnesses de agente e domínios como STEM, engenharia de software e trabalho do conhecimento. Filtramos rastros problemáticos usando verificações baseadas em modelos. O checkpoint de SFT resultante apresenta forte desempenho e comportamento aprimorado.

O Grok 4.6 é treinado em uma ampla variedade de tarefas de RL agêntico, incluindo trabalho do conhecimento, programação geral e ambientes específicos de domínio para otimização de kernel, desenvolvimento web, design assistido por computador e muito mais.

Transformando ideias ambiciosas em projetos funcionais

Testamos o Grok 4.6 em projetos elaborados para explorar seus limites e sua capacidade de manter o ritmo de trabalho ao longo de muitas etapas. Constatamos que o modelo é especialmente eficaz em transformar uma ideia abrangente de produto em uma primeira versão funcional. Ele consegue pesquisar domínios desconhecidos, estruturar o app, implementar as principais interações e continuar refinando o resultado ao longo de várias rodadas de feedback.

Em trajetórias mais longas, também começamos a observar mais autotestes e verificações, com o modelo conferindo o próprio trabalho antes de avançar.

O Grok 4.6 produz primeiras versões mais robustas em projetos visuais e interativos do que normalmente observávamos com o Grok 4.5. Dada uma ideia concreta de produto, ele é capaz de estabelecer a estrutura e a linguagem visual de um app em uma única passagem. Isso o tornou especialmente útil para projetos em que o caminho mais rápido para um bom resultado era começar com algo substancial e depois iterar nesse ciclo.

Segurança e capacidades

As proteções do Grok 4.6 foram aprimoradas e calibradas de acordo com as capacidades do modelo.

Nossa estrutura de segurança foi projetada para maximizar a utilidade e a segurança em casos de uso legítimos, permitindo que o Grok 4.6 seja útil e seguro em áreas como correção de vulnerabilidades, aceleração do ciclo de engenharia e ampliação da pesquisa em IA.

Nosso trabalho de avaliação das proteções reflete as capacidades ampliadas do Grok 4.6, com nossa mais ampla suíte de testes pré-implantação de capacidades e calibração de proteções, além de extensos testes de terceiros após a implantação.

Primeiros passos com o Grok 4.6

O Grok 4.6 já está disponível no Cursor e no Grok Build. Também está disponível pela API do SpaceXAI e por meio de parceiros, incluindo OpenRouter, Vercel e Cloudflare.

Os preços começam em 6 por milhão de tokens de saída. Há também uma variante rápida pelo dobro do preço.

Estamos oferecendo 2x mais uso no Cursor e no Grok Build durante a primeira semana.

Publicado em: Pesquisa

Autor: Cursor Team