Elon Musk classificou o Grok 4.5 como um modelo Opus-class que opera mais rápido e com menor custo. Um benchmark independente e autônomo agora oferece respaldo concreto para essa afirmação.
No AutomationBench-AA da Artificial Analysis, o Grok 4.5 atingiu o primeiro lugar com 51,4%, custando US$ 0,34 por tarefa. O desempenho superou tanto o Claude Fable 5 (48,6%) quanto o Claude Opus 4.8 (48,5%).
Patrocinado
Patrocinado
Avaliação independente da afirmação de Elon Musk
A SpaceXAI disponibilizou o Grok 4.5 publicamente nesta semana, desenvolvido com base em sua fundação V9 de 1,5 trilhão de parâmetros. A apresentação de Musk se baseou em avaliações internas preliminares.
O AutomationBench-AA altera esse cenário. A Artificial Analysis conduz o benchmark de forma independente, mantendo as tarefas em sigilo para evitar viés.
O teste abrange 657 tarefas em 40 aplicativos simulados, como Gmail, Slack, Salesforce e HubSpot. A avaliação mede a porcentagem de objetivos cumpridos por um agente sem ultrapassar limitações definidas.
Grok 4.5: mais acessível, ágil e amplamente estável
O custo por tarefa do Grok 4.5, de US$ 0,34, está bem abaixo do valor do Fable 5 (US$ 1,35) e Opus 4.8 (US$ 1,46). O Gemini 3.5 Flash foi o que mais se aproximou, com US$ 0,49.
O modelo utilizou cerca de 8 mil tokens de saída por tarefa, aproximadamente um quarto do total do Opus 4.8. Essa eficiência explica grande parte da diferença de custos, em linha com a apresentação feita por Musk.
“O uso total de tokens de 0,44 milhão por tarefa está entre os menores do ranking. O baixo custo resulta dessa eficiência aliada ao preço reduzido por token”, disse a Artificial Analysis em publicação.
Além disso, o Grok 4.5 concluiu 79,9% dos objetivos das tarefas e foi totalmente aprovado em 21,9% delas. No setor financeiro, considerado o mais desafiador, liderou com 71%, superando Fable 5 (64%) e Opus 4.8 (62%).
No entanto, o modelo infringiu mais regras que seus principais concorrentes. Registrou 0,63 violações por tarefa, acima das médias do Opus 4.8 (0,55) e do Gemini 3.5 Flash (0,46).
Esse detalhe é relevante para empresas que utilizam agentes em sistemas financeiros ao vivo, onde uma violação pode gerar custos concretos.


