Flere AI-vurderinger er ikke automatisk et stærkere bevis
Når flere AI-modeller indgår i samme opgave, får teamet flere mulige vurderinger. Min vurdering er, at værdien afhænger af, hvad den ekstra gennemgang undersøger, og hvilket grundlag modellerne deler.
Flere perspektiver kan stille flere spørgsmål
GitHubs HydraFusion-preview er et aktuelt eksempel på koordinering af modeller. Analysen handler om vurdering af resultater og indeholder ingen egen test af previewet.
En ekstra gennemgang kan være nyttig, hvis den undersøger antagelser, som udkastet tog for givet. Det kræver, at reviewopgaven beskrives tydeligt, og at indvendingerne vurderes mod opgavens faktiske krav.
Et fælles grundlag kan give en fælles fejl
Forestil dig et tænkt forløb, hvor alle modeller får en forældet produktbeskrivelse. Flere ensartede svar kan stadig bygge på den samme forkerte oplysning. Enigheden tilfører ikke den manglende opdatering.
Tilsvarende kan en uklar opgavebeskrivelse give flere rimelige løsninger på det forkerte problem. Teamet bør derfor kontrollere input og mål, før enighed bruges som argument for at acceptere resultatet.
Giv reviewet en særskilt opgave
Bed ikke kun om en generel vurdering af, om resultatet ser godt ud. Beskriv, hvilke antagelser, randtilfælde eller eksisterende arbejdsforløb gennemgangen skal undersøge.
Et tænkt eksempel er en formular, hvor udkastet håndterer normale værdier. Reviewet kan undersøge tomme felter og uventede tegn. Det giver en mere konkret indvending end en generel forsikring om kodekvalitet.
Brug et andet slags kontrolgrundlag
Min anbefaling er at kombinere sproglige vurderinger med en relevant observation: en test af adfærden, en kontrol mod den aktuelle kilde eller en faglig gennemgang af et kendt eksempel.
Denne kontrol bør kunne vise, at et resultat er forkert, også hvis alle modeller var enige. Ellers bliver den blot endnu en gentagelse af samme konklusion.
Vurdér det færdige resultat
Ekstra review har værdi, når det forbedrer løsningen eller gør dens begrænsninger tydeligere. Antallet af deltagende modeller er ikke alene et mål for den værdi.
Gem de konkrete fund og det endelige kontrolresultat. Det gør det muligt at vurdere, om den ekstra gennemgang var nyttig til netop denne type opgave, uden at gøre én vellykket prøve til en universel regel.