Majoritatea agenților AI nu sunt pregătiți pentru producție
52% dintre companii spun că au agenți AI în producție. Doar 5% sunt îngrijorați de acuratețea tool-calling. Diferența între deployed și de încredere e unde se face munca reală.
Cifrele din ultimul sondaj enterprise Anthropic sunt izbitoare: majoritatea organizațiilor pretind că au agenți în producție, dar foarte puține au măsurat dacă acei agenți fac de fapt ce ar trebui.
Iată adevărul incomod: livrarea unui agent care funcționează pe happy path e acum câteva weekend-uri de muncă. Livrarea unuia care funcționează a miilea oară, pe unhappy path, cu escaladarea potrivită când tool call-ul eșuează — asta e încă în mare parte inginerie scrisă manual.
- Demo — funcționează în sala de board, se strică la al doilea client.
- Beta — funcționează de cele mai multe ori; ai un canal Slack furios pentru eșecuri.
- Production — funcționează fiabil; ai observability, retry-uri, fallback-uri și o cale clară de escaladare.
- Compounding — se îmbunătățește în timp pentru că ai un eval harness, versionare de prompt și un feedback loop.
Majoritatea agenților „deployed” pe care îi văd sunt la nivelul 2.
- Un set formal de eval care trăiește lângă cod, rulează în CI și blochează upgrade-urile de model care regresează
- Telemetrie per tool call: latență, cost, succes/eșec, impact downstream
- Output-uri constrânse (JSON schema sau grammar) pentru orice câmp structurat
- O cale de degradare: dacă agentul eșuează de trei ori, predă unui om cu context complet
- Guardrails de cost impuse server-side
Veștile bune: fiecare dintre acestea e o problemă rezolvată. Veștile proaste: nimeni nu le va instala pentru tine, și majoritatea echipelor subestimează câte dintre ele au nevoie.
Continuă lectura
