# Nem todo agente é igual

O agente abre o pull request. O time aprova. O que acontece depois?

Um estudo recente analisou 37.623 PRs com proveniência marcada de cinco agentes comerciais — **OpenAI Codex**, **Devin**, **GitHub Copilot**, **Cursor** e **Claude Code** —, além de um *baseline* humano. Foram mapeados 2.807 repositórios no GitHub entre dezembro de 2024 e julho de 2025.

Três resultados se destacam — e nenhum deles se resume às frases simplistas "agentes são melhores" ou "agentes são piores".

> *"O agente abre o pull request. O time aprova. O que acontece depois é o que separa a ferramenta que ajuda da ferramenta que só adiciona fila."*

---

### 1. Taxa de Revert (Reversão pós-merge)

A frequência com que o código aceito precisa ser revertido varia drasticamente entre as ferramentas:

| Agente / Origem | Taxa de Revert (Estudo Principal) | Taxa de Revert (Estudo MSR 2026) | Perfil e Interpretação |
| :--- | :--- | :--- | :--- |
| **OpenAI Codex** | **6,1%** (Odds Ratio ~0.5x vs Humano) | **0,72%** (6x menor que humano) | Geração conservadora, alinhamento com padrões estabelecidos e tarefas bem delimitadas. |
| **Cursor** | *Não especificado* | **2,34%** | Mantém taxa de reversão substancialmente abaixo da média humana. |
| **Humano (Baseline)**| **11,5%** | **4,68%** | Referência de desenvolvimento manual. |
| **Devin** | **14,5%** (Odds Ratio 1,31x vs Humano)| **6,03%** | Maior probabilidade de reversão que o baseline humano. |
| **Claude Code** | *Não especificado* | **7,21%** | Propõe escopos mais amplos e refatorações que aumentam o risco pós-merge. |
| **GitHub Copilot** | *Não especificado* | **7,57%** (62% maior que humano) | Sugestões exploratórias e maior taxa de commits de reversão contidos no PR. |

---

### 2. Security Smells e Débito de Segurança

No agregado geral, o código gerado por agentes apresentou **37% menos chance** de conter um *security smell* em comparação ao código humano (Odds Ratio 0,63), puxado principalmente pela redução de credenciais *hardcoded* e uso de `eval` em tarefas rotineiras.

Porém, quando o escopo é filtrado apenas para **caminhos de alto risco** (CI/CD, containers, IaC, gerenciamento de secrets e scripts de shell em 16.370 mudanças de arquivos):

* **38,9% dos PRs de agentes** continham pelo menos um *security smell*.
* **Integridade da Supply Chain** respondeu por **82,3%** dos smells detectados (tags mutáveis de Actions/imagens Docker e instalações globais não fixadas).
* **Sobreasignação de privilégios e secrets** somaram 9,6% e 3,4%, respectivamente.
* **Credenciais Hardcoded:** Corresponderam a **99,6% dos smells críticos**. Contudo, a análise de atribuição revelou que colaboradores humanos — e não os agentes — foram responsáveis por introduzir **67,6% dos secrets genuinamente vazados** em fluxos assistidos por IA.
* **Taxas por Agente:** O **Copilot** registrou a maior taxa de smells em áreas de risco (45,5%), enquanto o **Codex** teve a menor (34,9%).

---

### 3. Esforço e Tempo de Code Review

A carga de revisão humana não é distribuída de forma uniforme e varia com o perfil do agente:

* **GitHub Copilot:** Registrou a maior frequência de pedidos de mudança (**22,6%**) e uma taxa de rejeição explícita de **11,1%** em 116.000 repositórios.
* **Claude Code:** Tende a gerar os maiores patches — média de **34 arquivos modificados** e **8.647 linhas alteradas** por requisição. Isso exigiu uma média de 3,4 reviews por PR e gerou a maior espera pelo primeiro review (mediana de 12,6 horas).
* **Agentes Autônomos (Devin e Claude Code):** Enfrentaram os ciclos de vida mais longos para integração final (**12,6 horas e 14,7 horas**, respectivamente). O gargalo não foi o tempo de computação do agente, mas o escrutínio assíncrono rigoroso dos revisores humanos.

---

### O que isso significa na prática

Qualidade pós-merge é o verdadeiro indicador de valor de um agente. Analisando 1.210 PRs de *bug-fix* em repositórios Python com o SonarQube, pesquisadores confirmaram que o sucesso no merge não reflete a qualidade do código entregue: as diferenças brutas de *issues* desaparecem quando normalizadas pelo tamanho do PR, dominadas por *code smells* graves e bugs pouco frequentes, porém severos.

Tratar "agente de IA" como uma categoria única esconde nuances operacionais críticas. Para quem opera em produção, a pergunta relevante é: **qual agente utilizar para qual tipo de mudança, considerando o custo de revisão e o perfil de risco pós-merge?**

---

### 📖 Governança e Auditoria de Código

Para se aprofundar na estruturação de processos de supervisão e auditoria de código gerado por IA, confira o **Volume VI — Supervisão e Auditoria de Código Gerado por IA** da série *Engenharia de Software Assistida por IA*.

💡 **Destaques:**
* 🏷️ Cupom de **30% OFF** nos eBooks: `LEIA30`
* 📖 Disponível também no **Kindle Unlimited**!

👉 **Série eBook completa:**  
%[https://link.amazon/B09KdiptI]

📖 **Livros Físicos (capa comum):**
* 📘 [Volume I - A Nova Realidade da Engenharia de Software](https://link.amazon/B0f0lA62q)
* 📙 [Volume II - Fundamentos que a IA Não Substitui](https://link.amazon/B0bOT75io)
* 📗 [Volume III - Engenharia de Requisitos na Era da IA](https://link.amazon/B0ciMaCFt)
* 📕 [Volume IV - Arquitetura e Design de Soluções na Era da IA](https://link.amazon/B0e8Z2sbn)
* 📓 [Volume V - Delegação Técnica para IA](https://link.amazon/B0eBJJBKm)
* 📔 [Volume VI - Supervisão e Auditoria de Código Gerado por IA](https://link.amazon/B0iK7wRo0)
* 📒 [Volume VII - Aplicações Reais](https://link.amazon/B0cPlnWBN)
* 📗 [Volume VIII - Engenharia de Contexto e Governança de IA](https://link.amazon/B0dmK7jno)

🔗 **Página do autor na Amazon:**  
%[https://link.amazon/B0igkvwcK]

---

### 📚 Fontes da Pesquisa

1. **Not All Agents Are Equal: Code Quality and Post-Merge Maintenance Across Five Autonomous Coding Agents in the Wild** – arXiv, setembro/2026. Kraishan, O. Estudo de 37.623 PRs em 2.807 repositórios.
2. **When AI Code Doesn't Stick: An Empirical Study on Reverted Changes Introduced by AI Coding Agents** – MSR 2026. Análise de 1.141 commits de revert em 893 PRs.
3. **Trust but Verify? Uncovering the Security Debt of Autonomous Coding Agents** – arXiv, julho/2026. Análise de 16.370 mudanças de arquivo em 4.064 PRs de alto risco.
4. **Beyond Bug Fixes: An Empirical Investigation of Post-Merge Code Quality Issues in Agent-Generated Pull Requests** – arXiv, janeiro/2026. Análise com SonarQube em 1.210 PRs de bug-fix.
5. **AI Coding Agents in Production: A Large-Scale Analysis of Pull Request Lifecycles** – Análise de 933.000 PRs e ciclos de vida de desenvolvimento.

---

\#EngenhariaDeSoftware \#AgentesDeIA \#CodeQuality \#CodeReview #PostMerge \#SWEBench #Seguranca \#GovernancaIA \#FuturoDaEngenharia
