Cursor Composer 2.5 bate GPT-5.5 em código a $0,07 por tarefa
A Cursor lançou o Composer 2.5 sobre a base open-weight Kimi K2.5, com 85% do compute em RL próprio. Terceiro no Coding Agent Index, a $0,07 por tarefa — 10 a 60× mais barato que os rivais. Prova de que o fine-tuning especializado atinge o frontier do coding.
Resumo
A 18 de maio, a Cursor lançou o Composer 2.5. O modelo é construído sobre o Kimi K2.5 (base open-weight da Moonshot AI), com 85% do compute de treino dedicado a reinforcement learning desenvolvido internamente. Resultado: terceiro lugar no Coding Agent Index da Artificial Analysis, 77,6% no SWE-Bench Verified multilíngue e um custo de $0,07 por tarefa. Os principais rivais ficam entre $0,70 e $4,20 por tarefa — 10 a 60 vezes mais caro. O benchmark inclui vitória direta sobre o GPT-5.5 no SWE-Bench Multilingual.
Na prática
O Composer 2.5 está disponível no editor Cursor como opção padrão para tarefas agênticas de duração média. O custo de $0,07 por tarefa muda o comportamento de uso: correr o agente em iteração rápida deixa de exigir controlo de fatura. Para equipas que já usam o Cursor como ambiente principal, não há mudança de workflow — o modelo substituiu em segundo plano.
Contexto
O que torna este lançamento relevante não é o benchmark — é o caminho técnico. Mostra que o fine-tuning de um modelo open-weight com RL especializado consegue competir com os melhores modelos fechados em coding. Não é imitação de um modelo maior: 85% do compute foi em post-training próprio sobre uma base aberta. Este padrão — modelo open-weight de qualidade mais RL vertical — está a tornar-se viável para startups sem escala para treinar from scratch. Kimi K2.6, o modelo seguinte da Moonshot AI, ficou entretanto em 4.º lugar no Artificial Analysis Intelligence Index geral, o que valida a base que a Cursor usou.
Porque importa
- $0,07 por tarefa contra $0,70–$4,20 dos rivais: 10 a 60× mais barato com resultados de topo
- 85% do compute em RL próprio sobre base open-weight — o fine-tuning especializado chega ao frontier sem treino from scratch
- Terceiro no Coding Agent Index global, atrás apenas de modelos closed frontier
- Prova de conceito para startups: não é necessário compute massivo de treino para competir em coding agêntico