Jesse Vincent (obra) / verification-before-completion
Como impedir um agente de dizer pronto quando não está?
Fazendo da evidência, e não da confiança, a condição para terminar.
O que vale lembrar
- O custo de um falso concluído é pago depois, por alguém com menos contexto.
- Defina o que conta como evidência por tarefa, ou você receberá o que for mais fácil de produzir.
- Combina direto com webapp-testing, que é quem produz a evidência.
- É hábito, não garantia. O agente ainda pode verificar cuidadosamente a coisa errada.
01O que muda na prática
Agentes não mentem tanto quanto concluem cedo. O código parece certo, o raciocínio é coerente, e o relatório de sucesso sai com a mesma confiança de tudo o mais. Exigir evidência muda do que esse relatório é feito.
Também muda a revisão. Ler ações e observações leva segundos, enquanto reconstruir a partir de um diff se a mudança funciona leva muito mais e acaba sendo pulado.
02Onde decepciona
Ainda é possível verificar a coisa errada. Uma captura da tela errada não é evidência de nada, então diga o que conta em cada tarefa.
Ela também adiciona um passo em loops curtos onde você conferiria de qualquer jeito, que é o único caso em que a sobrecarga é real.
Instalação e primeira execução
- Instale o superpowers a partir de obra/superpowers, sob licença MIT.
- Diga o que conta como evidência nesta tarefa: um teste passando, uma captura, um log de requisição.
- Rejeite relatórios de conclusão que trazem conclusões mas nenhuma observação.
Perguntas que as pessoas realmente fazem
- O que conta como evidência?
- Algo observado e não concluído: resultado de teste, captura, linha de log, corpo de resposta. Diga qual você quer.
- Isso atrasa o trabalho?
- Um pouco por tarefa, e muito menos que o retrabalho de agir sobre um relatório falso.
- Funciona com outras skills?
- Sim. webapp-testing produz a evidência; esta torna produzir evidência não opcional.
Fontes
Versões legíveis por máquina desta página