Grok 4.5 lidera teste de agentes e reforça afirmação de Musk sobre classe Opus

Resumo:O Grok 4.5 liderou o AutomationBench-AA com 51,4% e US$ 0,34 por tarefa, sustentando a afirmação de Elon Musk sobre custo e eficiência.

Elon Musk classificou o Grok 4.5 como um modelo Opus-class que opera mais rápido e com menor custo. Um benchmark independente e autônomo agora oferece respaldo concreto para essa afirmação.

No AutomationBench-AA da Artificial Analysis, o Grok 4.5 atingiu o primeiro lugar com 51,4%, custando US$ 0,34 por tarefa. O desempenho superou tanto o Claude Fable 5 (48,6%) quanto o Claude Opus 4.8 (48,5%).

Patrocinado

Patrocinado

Avaliação independente da afirmação de Elon Musk

A SpaceXAI disponibilizou o Grok 4.5 publicamente nesta semana, desenvolvido com base em sua fundação V9 de 1,5 trilhão de parâmetros. A apresentação de Musk se baseou em avaliações internas preliminares.

O AutomationBench-AA altera esse cenário. A Artificial Analysis conduz o benchmark de forma independente, mantendo as tarefas em sigilo para evitar viés.

O teste abrange 657 tarefas em 40 aplicativos simulados, como Gmail, Slack, Salesforce e HubSpot. A avaliação mede a porcentagem de objetivos cumpridos por um agente sem ultrapassar limitações definidas.

Grok 4.5: mais acessível, ágil e amplamente estável

O custo por tarefa do Grok 4.5, de US$ 0,34, está bem abaixo do valor do Fable 5 (US$ 1,35) e Opus 4.8 (US$ 1,46). O Gemini 3.5 Flash foi o que mais se aproximou, com US$ 0,49.

O modelo utilizou cerca de 8 mil tokens de saída por tarefa, aproximadamente um quarto do total do Opus 4.8. Essa eficiência explica grande parte da diferença de custos, em linha com a apresentação feita por Musk.

“O uso total de tokens de 0,44 milhão por tarefa está entre os menores do ranking. O baixo custo resulta dessa eficiência aliada ao preço reduzido por token”, disse a Artificial Analysis em publicação.

Além disso, o Grok 4.5 concluiu 79,9% dos objetivos das tarefas e foi totalmente aprovado em 21,9% delas. No setor financeiro, considerado o mais desafiador, liderou com 71%, superando Fable 5 (64%) e Opus 4.8 (62%).

No entanto, o modelo infringiu mais regras que seus principais concorrentes. Registrou 0,63 violações por tarefa, acima das médias do Opus 4.8 (0,55) e do Gemini 3.5 Flash (0,46).

Esse detalhe é relevante para empresas que utilizam agentes em sistemas financeiros ao vivo, onde uma violação pode gerar custos concretos.

Isenção de responsabilidade

Os pontos de vista expressos neste artigo representam a opinião pessoal do autor e não constituem conselhos de investimento da plataforma. A plataforma não garante a veracidade, completude ou actualidade da informação contida neste artigo e não é responsável por quaisquer perdas resultantes da utilização ou confiança na informação contida neste artigo.
Postagem anterior

Stablecoins movimentam US$ 76 bilhões a cada fim de semana, volume comparável ao da Visa em dias úteis

Próximo

Baleias impulsionam Bitcoin aos US$ 64 mil após sinal da Coinbase, diz CryptoQuant