AI-monitoring: het gevaarlijkste wat een AI-systeem doet is niets zeggen

Op 5 september gebruikte ik mijn eigen sales-copilot een ochtend lang in echte gesprekken. Aan het eind had ik vier fouten gevonden.

Geen van de vier gaf een foutmelding. Geen regel in een logboek, geen rood lampje op het scherm. Het systeem deed gewoon minder dan ik dacht. En het zei dat niet.

Dat is waar AI-monitoring meestal misgaat. Hij let op crashes. Maar een AI-systeem dat crasht, merk je vanzelf. Een systeem dat stil stopt, merk je pas als de schade er al is.

Een crash is het goede scenario

Als een systeem crasht, weet iedereen het binnen een minuut. Er komt een melding, iemand kijkt ernaar, het wordt gerepareerd.

Een stille fout werkt andersom. Alles lijkt te draaien. Het dashboard staat op groen. Alleen gebeurt er van binnen iets anders dan je denkt.

Voor een directeur is dat het gevaarlijke deel. Je neemt beslissingen op basis van een systeem waarvan je aanneemt dat het werkt. En niemand in je bedrijf kan je vertellen dat het dat niet doet. Het systeem zegt het zelf niet.

Vier stille fouten op één ochtend

Dit waren ze, in gewone taal.

De schakelaar die zichzelf uitzette. De detectie van klantpijnpunten had een aan-uitknop. Bij elke keer dat de pagina opnieuw laadde, zette een instelling hem stil weer uit. Het gesprek liep en het scherm zag er normaal uit. Er werd alleen niets gedetecteerd.

Het onderdeel dat nooit startte. Door die uitgezette schakelaar startte het onderdeel dat de gesproken tekst beoordeelt gewoon niet. Het logboek noemde alleen wat wél aan stond. Vier gesprekken, negen transcripten, nul detecties, en nergens een regel die dat zei.

De koppeling die verdween zonder spoor. Een verbinding naar een ander systeem kon midden in een gesprek wegvallen. Er bleef niets achter dat zei wanneer of waarom.

De herkenning die te snel ja zei. Eén gedeeld woord was genoeg om een pijnpunt te herkennen, met een vaste zekerheid van 95%. Die zekerheid betekende dus niets.

Vier fouten naast elkaar, elk met een groen scherm aan de buitenkant en een stil probleem aan de binnenkant
Vier fouten op één ochtend, en geen enkele melding

Wat ik eraan veranderde

De reparatie was bij alle vier hetzelfde principe: een systeem moet melden wat het níet doet, niet alleen wat het wel doet.

  • De detectie meldt nu bij de start dat hij draait. Tussendoor geeft hij een teken van leven en aan het eind een telling. Staat hij uit, dan staat dat zichtbaar op het scherm.
  • Elk onderdeel dat iets weggooit, telt wat het weggooit en waarom.
  • De koppeling schrijft een eigen logboek, met altijd een regel over waarom hij stopte.
  • De zekerheid van de herkenning hangt nu af van hoeveel er echt overeenkomt. Op een testset van 78 zinnen ging de precisie van 0,855 naar 0,942. Er wordt niets meer gemist dat eerder wel werd gevonden.

Dat laatste getal is mijn bewijsdetail. Het is minder belangrijk dan het lijkt. Het echte verschil is dat ik nu kan zien of de herkenning werkt. Daarvoor kon ik dat niet.

Hetzelfde patroon in mijn eigen governance

Een paar weken later vond ik hetzelfde patroon in de laag die mijn andere AI-systemen bewaakt. Daar heet het intern "absence is loud": afwezigheid moet lawaai maken.

Een rapport zonder modelnaam werd terecht geweigerd. Maar het bleef liggen en werd bij elke controle opnieuw geweigerd. Vijftien van zulke rapporten hielden het alarm dagenlang op rood. Een nieuwe weigering viel daardoor niet meer op.

Nu gaat zo'n rapport in quarantaine en blijft de weigering 24 uur zichtbaar. Een onderdeel dat ik bewust had stilgezet, werd als storing gemeld. Nu meldt het zich als "geparkeerd", met de reden erbij.

Dat klinkt als het omgekeerde probleem. Het is hetzelfde. Een alarm dat altijd aan staat, zegt net zo weinig als een alarm dat nooit afgaat. In beide gevallen zie je de volgende echte fout niet.

Wat AI-monitoring dus moet meten

Vier vragen die je aan elk AI-systeem in je bedrijf kunt stellen. Je hoeft er geen technicus voor te zijn.

  1. Hoe weet ik dat dit systeem vandaag iets heeft gedaan? Dus niet of het draait. Wel of het werk heeft verzet.
  2. Wat gebeurt er met werk dat het niet kan verwerken? Wordt dat geteld en gemeld, of verdwijnt het?
  3. Kan een onderdeel uit staan zonder dat ik het zie? Zo ja, dan is dat je eerste reparatie.
  4. Betekent "geen meldingen" dat alles goed gaat, of dat niemand keek? Als niemand dat kan beantwoorden, weet je genoeg.

Wie deze vragen voor al zijn AI-systemen kan beantwoorden, heeft zijn monitoring op orde. Wie dat niet kan, draait op vertrouwen. Hoe je dat soort afspraken vastlegt als onderdeel van je governance, beschrijf ik in AI-governance voor het MKB.

Lees ook: Elke poort stond groen. De keten ertussen lekte.

Veelgestelde vragen

Vincent van Deth

AI Strategy & Architecture

Vincent van Deth bouwt productiesystemen met AI voor het MKB. Hij is de maker van VNX, een multi-agent LLM orchestrator, en helpt teams betrouwbare AI-automatisering te shippen — zonder bullshit.

Reacties

Je e-mailadres wordt niet gepubliceerd. Reacties worden beoordeeld voor plaatsing.

Reacties laden...