Por Melhores Tech · deslize para ver →
Nova versão do benchmark do Google mede agentes de IA em tarefas longas de desenvolvimento Android; GPT-6 Astra fica em 1º e Gemini 3.8 Flash marca 8%.
É a segunda versão do benchmark do Google que avalia modelos de linguagem e agentes de IA em tarefas de desenvolvimento para Android. A novidade são as tarefas de longo horizonte, que equivalem a dias ou até uma semana de…
O GPT-6 Astra, da OpenAI, rodando no agente Codex, liderou com 28% de aprovação nas tarefas longas. Em seguida vieram o Claude Fable 5.1 (22,7%), o GPT-5.6 Sol (19,3%) e o Claude Opus 5 (16,7%). O Gemini 3.8 Flash, do próprio…
Porque as tarefas são grandes e o critério de aprovação é rígido: o agente precisa concluir o trabalho inteiro. Por isso o Google passou a divulgar também a taxa de conclusão parcial, em que os líderes passam de 80%.
melhorestech.com