Klankbord: synthetische panels die zichzelf wantrouwen
Een lokaal platform dat fictieve persona's in isolatie laat reageren op koppen, prijzen en voorstellen. De kern is niet het panel, maar de controlelaag die het oordeel mag tegenhouden.
Het probleem
Ik wilde koppen, prijzen en voorstellen toetsen voordat ze naar echte mensen gaan. Een model vragen "wat vindt mijn doelgroep hiervan" geeft altijd een vlot antwoord, en dat antwoord is meestal een spiegel van de vraag. Zonder controles is dat geen onderzoek, maar een duurdere manier om jezelf gelijk te geven.
Wat ik gebouwd heb
Een lokaal platform waarin fictieve persona's los van elkaar antwoorden, met een controlelaag als eigenlijke product:
Placebo-arm: een lege variant meedraaien, zodat ik zie of mijn tekst het beter doet dan niets
Ankers en canaries: vragen waarvan het echte Nederlandse cijfer bekend is, om te zien waar het panel systematisch afwijkt
Negatieve controles: persona's met vastgepinde feiten, om te meten of ze meebewegen met wat ik suggereer
Scepticus en anti-persona: standaard in elke steekproef, zodat instemming niet de enige stem is
Tegenlezer: een aparte beoordelaar die het eindoordeel mag verlagen of tegenhouden
Voorspellings-ledger: elke studie legt een toetsbare voorspelling vast, zodat ik later kan zien of het panel gelijk had
Drie oppervlakken op een servicelaag: een web-UI, een commandoregel en een MCP-server met 19 tools
Wat ik geleerd heb
De eerste twee echte studies eindigden allebei op "oordeel ingehouden", omdat de tegenlezer een verzonnen cijfer in de samenvatting ving en een gemiddelde dat als citaat was opgevoerd. Dat is geen mislukking, dat is het systeem dat doet waarvoor het gebouwd is.
De ankers wezen een structurele scheefstand aan: het panel schat stiekem AI-gebruik veel lager in dan de echte cijfers en verwacht vrijwel nooit een correct antwoord van AI. Synthetische persona's zijn braver en sceptischer dan Nederland.
Persona's geven vooral terug welk briefingfeit ze pakken. Geef je ze een controleergewoonte mee, dan is controleren de grootste frustratie. Sindsdien randomiseer ik zulke feiten of laat ik ze weg.
Het eerste ontwerp toonde een kaart per persona per variant. Veertig kaarten is een muur tekst, geen resultaat. Nu is het een kaart per persona, met het oordeel bovenaan en alle techniek in een lade.
Resultaat
Een studie kost ongeveer tien minuten en een paar euro, en levert persona-stemmen met een oordeel dat expliciet zegt hoe hard het is: genoeg om op te handelen, een hint, of geen uitspraak. Het draait als dienst op mijn eigen machines, bereikbaar op mijn privénetwerk en nergens anders.