comparativo · 04 de outubro de 2026 · 26:49
15 harness de IA comparados: como escolher pela sua rotina
O autor explica que o modelo é uma parte do sistema e que o harness organiza o trabalho dele com ferramentas. Compara 15 opções pela documentação oficial, com benefício e ponto de atenção de cada uma, e faz um teste local com uma função de conversão de valores monetários e uma bateria de 16 casos. A escolha, para ele, começa pela rotina, e a diferença-chave é quanto controle, configuração e revisão cada opção exige de você.

O que separa os dois
01O que é harness
É o programa que organiza o trabalho de um modelo com ferramentas. Ele prepara o contexto, apresenta as ferramentas disponíveis, recebe a ação proposta pelo modelo, executa o que está permitido e devolve o resultado, até a tarefa terminar ou atingir um limite.
02Modelo e produto são coisas diferentes
O autor diz que Claude Code e Codex são produtos que organizam uma experiência de trabalho com modelos, ferramentas e regras. O harness conecta o trabalho ao ambiente, mas não assume a responsabilidade humana pelo resultado. Uma permissão escrita no prompt não equivale a um freio: para impedir uma ação, o ambiente precisa aplicar o bloqueio.
03As 15 opções, uma a uma
Claude Code, Codex, OpenCode com DeepSeek V4.1 Flash, DeepSeek Harness (DSH), Pi, Devin, Qwen Code, Gemini CLI, Cursor Agent, GitHub Copilot CLI, Cline, Amp, Aider, Goose e OpenHands. Para cada uma, ele traz o que a documentação oficial descreve, o benefício e o ponto de atenção.
04O teste local
Uma função pequena com erro de conversão de valores monetários. Ela precisava transformar uma string em centavos, aceitar ponto ou vírgula e rejeitar formatos inválidos. A bateria tinha 16 casos, a mesma especificação valeu nas execuções e o agente só podia corrigir a função. Claude Code, Codex, Pi e DSH concluíram a correção, e o OpenCode com DeepSeek V4.1 Flash também funcionou bem neste teste.
05Dois bloqueios de acesso
O acesso pelo OpenCode Go recusou o modelo por uma restrição de região, e a configuração de privacidade não foi alterada. No Devin, os modelos SWE selecionados exigiram um plano Pro. Ele registrou os dois como bloqueio de acesso, não como falha do código, e comparou os demais produtos pela documentação oficial.
06O que o teste não prova
Uma função corrigida não prova que o agente resolve uma migração inteira, e os modelos e as configurações não eram iguais. Para isolar o harness, seria preciso manter o modelo e as condições, repetir as execuções e variar as tarefas.
07Como escolher pela rotina
Para desenvolvimento acompanhado com um produto integrado, Claude Code e Codex entram cedo na avaliação. Para experimentar modelos e provedores numa experiência aberta, OpenCode. Se personalizar o ambiente é parte do trabalho, Pi e DSH. Com o editor no centro, Cursor e Cline; com Git e terminal, o Copilot CLI; para delegar tarefas verificáveis, Devin; para automação com ferramentas, Goose; para construir e operar uma infraestrutura de agentes, OpenHands.
Perguntas
O que é um harness de IA?
É o programa que organiza o trabalho de um modelo com ferramentas: prepara o contexto, apresenta as ferramentas, executa o que está permitido e devolve o resultado, até a tarefa terminar ou atingir um limite.
Como escolher sem instalar todas as opções?
O autor sugere escolher duas opções, usar um projeto de teste e três tarefas da sua rotina: entender um trecho, corrigir um erro e conferir uma mudança. Registre resultado, tempo, consumo e intervenção humana.
Trocar o modelo muda o resultado?
Segundo o autor, mudar o modelo também muda o comportamento, e compatibilidade de conexão não prova a qualidade de uma entrega.
Quer ir além do vídeo?
Continue por aqui
Este resumo foi escrito a partir da transcrição do vídeo. As citações são literais. Para o conteúdo completo, assista no YouTube.