Saltar para o conteúdo
GOPPO

Notícias · IA resumida para perceber o essencial

Voltar às notícias

Dev e Builders

Publicado em

Cursor Composer 2.5 bate GPT-5.5 em código a $0,07 por tarefa

A Cursor lançou o Composer 2.5 sobre a base open-weight Kimi K2.5, com 85% do compute em RL próprio. Terceiro no Coding Agent Index, a $0,07 por tarefa — 10 a 60× mais barato que os rivais. Prova de que o fine-tuning especializado atinge o frontier do coding.

  • cursor
  • coding-agents
  • open-weights
  • reinforcement-learning
  • llm

Resumo

A 18 de maio, a Cursor lançou o Composer 2.5. O modelo é construído sobre o Kimi K2.5 (base open-weight da Moonshot AI), com 85% do compute de treino dedicado a reinforcement learning desenvolvido internamente. Resultado: terceiro lugar no Coding Agent Index da Artificial Analysis, 77,6% no SWE-Bench Verified multilíngue e um custo de $0,07 por tarefa. Os principais rivais ficam entre $0,70 e $4,20 por tarefa — 10 a 60 vezes mais caro. O benchmark inclui vitória direta sobre o GPT-5.5 no SWE-Bench Multilingual.

Na prática

O Composer 2.5 está disponível no editor Cursor como opção padrão para tarefas agênticas de duração média. O custo de $0,07 por tarefa muda o comportamento de uso: correr o agente em iteração rápida deixa de exigir controlo de fatura. Para equipas que já usam o Cursor como ambiente principal, não há mudança de workflow — o modelo substituiu em segundo plano.

Contexto

O que torna este lançamento relevante não é o benchmark — é o caminho técnico. Mostra que o fine-tuning de um modelo open-weight com RL especializado consegue competir com os melhores modelos fechados em coding. Não é imitação de um modelo maior: 85% do compute foi em post-training próprio sobre uma base aberta. Este padrão — modelo open-weight de qualidade mais RL vertical — está a tornar-se viável para startups sem escala para treinar from scratch. Kimi K2.6, o modelo seguinte da Moonshot AI, ficou entretanto em 4.º lugar no Artificial Analysis Intelligence Index geral, o que valida a base que a Cursor usou.

Porque importa

  • $0,07 por tarefa contra $0,70–$4,20 dos rivais: 10 a 60× mais barato com resultados de topo
  • 85% do compute em RL próprio sobre base open-weight — o fine-tuning especializado chega ao frontier sem treino from scratch
  • Terceiro no Coding Agent Index global, atrás apenas de modelos closed frontier
  • Prova de conceito para startups: não é necessário compute massivo de treino para competir em coding agêntico