Article · 6 de maig del 2026 · 7 min de lectura

La necessitat de l’observabilitat per als agents d’IA

Els agents d’IA no només responen a les indicacions. Recuperen context, trien eines, criden sistemes i fan avançar la feina. Per executar-los en producció, els equips necessiten visibilitat sobre tot el procés, no només sobre la resposta final.

Tauler d’observabilitat de Guanta amb mètriques de rendiment i revisió operativa de la IA.

Els agents converteixen l’observabilitat en un requisit empresarial

Els equips de programari ja entenen per què és important l’observabilitat. Els registres, les mètriques, les traces, les alertes i els fluxos de treball d’incidències ajuden els equips a entendre si un sistema funciona correctament i per què ha canviat alguna cosa. Els agents d’IA també tenen aquesta necessitat, però hi afegeixen un problema més complex: el sistema ja no és només programari determinista.

Un agent pot rebre dues vegades la mateixa sol·licitud i produir resultats diferents. Pot recuperar un context diferent, cridar una eina diferent, seguir un pla diferent o aturar-se abans del que s’esperava. Una resposta tècnicament correcta encara pot ser errònia, incompleta, massa cara, massa lenta o inadequada per al procés empresarial que ha de donar suport.

Per això, l’observabilitat dels agents no es pot reduir al temps d’activitat. Una resposta 200 d’un endpoint d’un LLM no significa que l’agent hagi fet la feina correcta. Els equips de producció han de saber què ha vist l’agent, què ha utilitzat, què ha decidit, què ha canviat i si el resultat ha generat valor.

Les fallades de la IA sovint es produeixen de manera silenciosa

Les aplicacions tradicionals solen fallar de maneres fàcils de detectar: un servei cau, una sol·licitud supera el temps d’espera, una tasca falla o un tauler deixa de carregar. Els agents d’IA poden fallar de manera més silenciosa. Poden respondre amb confiança mentre utilitzen coneixement desactualitzat. Poden ometre una crida important a una eina. Poden resumir incorrectament un document. Poden generar un resultat que sembla plausible però no compleix el requisit operatiu.

Les fallades silencioses són especialment perilloses quan els agents estan connectats a fluxos de treball reals. En un procés d’assistència, l’agent podria derivar el cas a l’equip equivocat. En un procés de documentació clínica, podria ometre proves que afecten el reemborsament. En un flux de treball regulador, podria no conservar la traçabilitat necessària per a la revisió.

El risc operatiu no és només que el model s’equivoqui. El risc és que l’organització no pugui veure en quin punt s’ha introduït l’error en el sistema.

La resposta final només és l’últim tram

Molts equips comencen supervisant la resposta final: ha estat útil, factual, rellevant, segura i coherent amb la marca? Aquestes comprovacions són importants. Però no són suficients per als agents en producció, perquè la resposta final només és l’extrem visible d’un flux de treball més llarg.

L’observabilitat dels agents ha de seguir el procés des de l’origen fins al resultat. Això significa fer un seguiment de la sol·licitud de l’usuari, la intenció detectada, la versió de la indicació, el coneixement recuperat, el model utilitzat, les eines cridades, els permisos aplicats, la latència i el cost de cada pas, el resultat final i l’impacte posterior.

Sense aquest recorregut complet, els equips poden veure que una resposta ha estat deficient però continuar sense saber per què. La indicació era feble? Les dades d’origen eren incompletes? La recuperació ha retornat el document equivocat? Una eina ha fallat silenciosament? El model era massa petit per a la tasca? L’agent ha triat la branca equivocada del procés? L’observabilitat converteix aquestes preguntes en proves.

Què haurien de supervisar els equips

Els senyals exactes depenen del cas d’ús, però els agents en producció solen necessitar visibilitat en diverses capes.

  • Entrada i intenció: què ha sol·licitat l’usuari o el sistema, com s’ha classificat la petició i quin flux de treball s’ha activat.
  • Context i recuperació: quins documents, registres, llocs web, bases de dades o fonts de coneixement internes s’han utilitzat.
  • Execució del model i de les indicacions: versions de les indicacions, elecció del model, paràmetres, latència, cost, reintents i errors.
  • Activitat d’eines i sistemes: crides a API, consultes a bases de dades, accions del navegador, permisos, aprovacions i derivacions.
  • Qualitat del resultat: rellevància, veracitat, exhaustivitat, to, compliment de les polítiques i utilitat per al flux de treball.
  • Resultat empresarial: si l’agent ha resolt la sol·licitud, ha reduït la feina manual, ha millorat la conversió, ha estalviat temps o ha creat un valor operatiu mesurable.

Les avaluacions i les traces són la base

Hi ha dues capacitats especialment importants: les avaluacions i les traces.

Les avaluacions ajuden els equips a jutjar la qualitat dels resultats a escala. Algunes comprovacions són deterministes, com ara verificar si hi ha un camp obligatori o si una resposta inclou una afirmació prohibida. D’altres utilitzen avaluacions basades en models per valorar aspectes com la utilitat, la rellevància, l’exhaustivitat o si la resposta es fonamenta en un context aprovat.

Les traces expliquen com s’ha produït un resultat. Una traça útil mostra els passos que ha fet l’agent, els sistemes que ha utilitzat, el context que ha recuperat i el cost i la latència de cada part de l’execució. Per als equips que operen processos reals, les traces no són només una funció de depuració. Són la manera de revisar incidències, respondre les preguntes de les parts interessades i millorar el flux de treball amb el temps.

L’observabilitat ha d’incloure dades, codi, sistemes i models

Un error habitual és tractar l’observabilitat com una cosa que comença i acaba en el límit del model. A la pràctica, molts problemes que semblen problemes del model tenen l’origen aigües amunt o aigües avall.

Les dades d’origen poden estar desactualitzades. Un document pot haver-se indexat incorrectament. Un canvi en una indicació pot haver reduït el rendiment per a un segment concret d’usuaris. Una eina pot estar retornant resultats parcials. Una regla de permisos pot ser massa àmplia o massa restrictiva. El model pot funcionar bé, però el flux de treball que l’envolta pot ser deficient.

Les operacions d’IA fiables requereixen visibilitat sobre tot el sistema: la capa de dades, la capa d’aplicació, la capa de les indicacions i el codi, les eines connectades i la capa del model. Els agents són sistemes de sistemes. L’observabilitat ha d’estar a l’altura d’aquesta realitat.

L’objectiu no són els taulers. L’objectiu és el control.

La supervisió només és útil si els equips poden actuar a partir del que aprenen. Un tauler que mostra una taxa d’errors creixent, un cost més alt o una puntuació d’avaluació més baixa és un punt de partida. El valor real prové de poder resoldre la incidència.

Això pot significar canviar una indicació, substituir una font de coneixement, desactivar una eina, restringir els permisos, afegir un pas de revisió humana, traslladar un flux de treball a un altre model o crear una nova avaluació per a un mode de fallada que abans no era visible.

És aquí on l’observabilitat esdevé operativa. Proporciona als equips un bucle de retroalimentació: observar què ha passat, entendre per què ha passat, modificar el sistema i mesurar si el canvi ha millorat el procés.

Com començar

Els equips no han d’instrumentar-ho tot el primer dia. Però haurien de començar pels senyals que corresponen al risc del procés. Un assistent per a un lloc web públic pot començar amb la qualitat de les respostes, les preguntes sense resposta, el cost i la conversió. Un agent intern d’operacions pot necessitar traces de les eines, permisos, aprovacions i finalització de tasques. Un flux de treball regulat pot necessitar des del principi l’historial de proves, el control de versions i els registres de revisió.

El pas important és dissenyar l’observabilitat abans que l’agent esdevingui crític. Els pilots poden funcionar amb revisió manual i depuració puntual. Els fluxos de treball en producció, no. Quan hi intervenen usuaris reals, dades reals i decisions empresarials reals, la pregunta ja no és si l’agent pot oferir una bona demostració. La pregunta és si l’organització pot operar-lo de manera responsable.

Els agents d’IA seran més útils a mesura que obtinguin accés a més context i més eines. Això també els farà més difícils d’entendre sense la visibilitat adequada. L’observabilitat és la manera com els equips mantenen aquesta potència útil, mesurable i sota control.

Guanta

Crea agents que puguis entendre en producció

Guanta ajuda els equips a crear, executar i supervisar processos basats en IA amb la visibilitat necessària per a les operacions reals.

Explora el teu cas d’ús Tornar al blog