A Máquina da Confiança: Estudo de Caso em Desenvolvimento Agêntico Bancário
Mauricio Yokoyama Issei
0:00 / 0:00
A Máquina da Confiança: Estudo de Caso em Desenvolvimento Agêntico Bancário
3 просмотра · 1 день назад
Mauricio Yokoyama Issei
99 подписчиков
3 просмотра · 1 день назад
Tratar um modelo de linguagem (LLM) como o sistema completo é um dos erros de arquitetura mais comuns na IA aplicada. Em cenários simulados de atendimento bancário, enviar todas as requisições e centenas de ferramentas diretamente ao LLM gera latências elevadas, desperdício de tokens e riscos de execução inadequada por perda de contexto (*lost-in-the-middle*).
Neste vídeo, exploramos o estudo de caso *"Case Agents"**, uma demonstração teórica e simulada criada para validar o processo de desenvolvimento de um **Harness Determinístico em Camadas**. A partir do princípio da **Engenharia da Confiança* (*"A capacidade vem do modelo; a confiança vem da engenharia"*), analisamos como uma estrutura de triagem e guardas de segurança pré-execução valida a arquitetura de roteamento antes do acionamento de modelos mais complexos.
---
📌 O que você vai aprender neste vídeo:
*O Desafio do Catálogo Extenso:* Por que injetar centenas de ferramentas no prompt reduz a precisão da seleção e infla custos de inferência.
*Camada 1 — Query Router Local:* Como classificar intenções em menos de 5 ms através de um modelo leve (TF-IDF + Regressão Logística) calibrado por *Platt scaling*.
*Camada 2 — Tool Retriever & Taxonomia:* Como organizar ferramentas em capacidades canônicas e colapsar duplicatas semânticas para recuperar o Top-2 relevante.
*Camada 3 — Guardas de Direção e Segurança:* Como a verificação semântica de intenção (Leitura vs. Escrita) evita que uma simples consulta execute uma alteração cadastral indevida.
*Validação do Processo Agêntico:* Como o benchmark do MVP demonstrou a eficácia do Harness na contenção do "Crash Silencioso" em um ambiente controlado de testes.
---
📊 Resultados Medidos no Benchmark do MVP:
*Acurácia do Router:* 100.0%
*Hit Rate@2 do Retriever:* 100.0%
*Redução de Custo Medida:* 77,8% (vs. baseline sempre-LLM)
*Redução de Latência:* ~92,6%
*Execuções Incorretas no Dataset de Teste:* 0
(Nota: Resultados restritos ao benchmark simulado do MVP).
---
🔗 Links e Documentação de Referência:
🌐 *Artigo Explicativo e Apresentação do Case no Site:*
https://mauricio.issei.com.br/case-ag...
💻 *Repositório do Projeto no GitHub:*
https://github.com/issei/case-agents
📜 *Especificação Técnica Consolidada (Spec-Driven Development):*
https://github.com/issei/case-agents/...
📦 *Manifesto de Empacotamento de Produção (APM.yml):*
https://github.com/issei/case-agents/...
📈 *Relatório de Avaliação do Benchmark (candidate_report.json):*
https://github.com/issei/case-agents/...
#### 🏛 Architecture Decision Records (ADRs):
*ADR-001 (Normalização Textual Canônica):* https://github.com/issei/case-agents/...
*ADR-002 (Classificador Lexical & Query Router):* https://github.com/issei/case-agents/...
*ADR-003 (Ranking Determinístico & Tool Retrieval):* https://github.com/issei/case-agents/...
*ADR-004 (Harness de Avaliação & Economia):* https://github.com/issei/case-agents/...
*ADR-005 (Alinhamento APM & OmniRoute Gateway):* https://github.com/issei/case-agents/...
*ADR-006 (Taxonomia de Capacidades & Colapso de Duplicatas):* https://github.com/issei/case-agents/...
*ADR-007 (Calibração de Probabilidade & Guarda de Margem):* https://github.com/issei/case-agents/...
*ADR-008 (Guarda de Direção Leitura/Escrita):* https://github.com/issei/case-agents/...
#### 📚 Base de Conhecimento (OKF Agent Memory):
*Guia de Engenharia da Confiança:* https://github.com/issei/case-agents/...
*Catálogo de Casos de Borda em PT-BR:* https://github.com/issei/case-agents/...
*Arquitetura de Transição (MVP para Produção - ISM v1.0):* https://github.com/issei/case-agents/...
*Eficiência de Contexto e Anti-Bloat:* https://github.com/issei/case-agents/...