01Taakkwaliteit en ernstige fouten
Naast de gemiddelde score, worden valse toezeggingen, onjuiste bedragen, over-authorization responses, verkeerde tools call en niet-recoverable zakelijke acties afzonderlijk gecontroleerd.
02Kennisgegevens en versies
c) Erkenning van gezaghebbende bronnen, geldigheidsperioden, voorrechten, voltooiing van de index, gegevenssnapshots en herevaluatiemechanismen na wijzigingen.
03Identiteit en gereedschapszekerheid
Test minimale privileges, tips, indirecte instructies, argument excessen, gevoelige informatie, goedkeuring van bypass en meerdere Agent informatie voor vervalsing.
04Interface en consistentie van gegevens
Validatie van entropie, hertesting, compensatie, verzoening, timeout, beperking door derden en gedeeltelijk succes om te voorkomen dat inconsistenties in het AI-proces achterblijven.
05Prestatie- en exploitatiekosten
Controleer respons, wachtrij, cache, modelquota, enkele effectieve missiekosten en kostenwaarschuwingen onder representatie en contextlengte.
06Toezicht en traceerbaarheid
Logs moeten relevant zijn voor gebruikers, taken, modellen, kennis, tips, hulpmiddelen, goedkeuringen en bedrijfsresultaten, terwijl onnodige en gevoelige inhoudregistratie vermeden moet worden.
07Handmatige overname en bedrijfscontinuïteit
Voorbereiding op weigering, conversie, alleen-lezen, ontwerp, stand-by model, degradatie van de regels, missieherstel en nooduitzetting.
08Grijze en Vrijgave Governance
Identificeer de eerste gebruikers, de observatiecyclus, de voorwaarden voor uitbreiding, de voorwaarden voor mislukking, de terugrol van de versie en de taken voor terugkeer na release.