Kijk hoe AI in je catalogus winkelt.
Geef Herm een realistische klantbehoefte en kijk hoe een AI-winkelagent in je catalogus zoekt, vergelijkt en aanbeveelt. Herm beoordeelt of hij het juiste product vond, de aanbeveling onderbouwde met gezaghebbende informatie en de shopper naar een geldige plek stuurde om te kopen.
Een Winkeltest is één klantbehoefte, van begin tot eind uitgevoerd. Tests worden volgens een schema herhaald: lees de methodologie.
- 01 Shopper
- 02 Agent
- 03 Aanbeveling
- 04 Herm-evaluatie
“I want a vitamin C I can use every morning. It needs to be fragrance-free, gentle enough for daily use, suitable for sensitive skin and below £45.”
Velora Bright Boost C
“Fragrance-free with a buffered vitamin C, formulated for daily use on sensitive skin. Available in your size and in stock for UK delivery.”
Klanten beschrijven behoeften. Catalogi beschrijven producten. AI moet die twee verbinden.
Een Winkeltest begint bij een klant, niet bij een SKU. AI-commerce vraagt van de agent dat hij de situatie van een klant vertaalt naar productcriteria, geschikte opties ophaalt en een verdedigbare keuze maakt. Product Readiness test die keten.
Test echte koopsituaties, geen kunstmatige veldcontroles.
Herm bouwt representatieve koopsituaties van buitenaf op: zoals een shopper een behoefte beschrijft, met de voorwaarden en vragen die hij of zij meebrengt.
Het testen wordt sterker wanneer het merk inbrengt wat het al over zijn klanten weet. Intenties zijn vóór een run te beoordelen en aan te passen.
Kennis van categorieën en koopsituaties, opgebouwd onafhankelijk van het merk.
Wat het merk al weet over wie koopt en waarom.
Dit zijn representatieve koopsituaties. De generatiemethode en de onderliggende datasets zijn eigendom van Herm.
Klanten stellen moeilijkere vragen dan “zoek een gezichtscrème voor me”.
Een suite combineert beslissingstypen, omdat de manieren waarop een catalogus een klant tekortdoet niet allemaal hetzelfde zijn. Dit zijn de typen die momenteel worden ondersteund.
| Beslissingstype | Representatieve koopsituatie | Wat de test vaststelt |
|---|---|---|
| Need matching | “What is the best option for daily use on sensitive skin?” | Whether an appropriate eligible product is retrieved and defended for the stated need. |
| Constraint handling | “Under £45, fragrance-free, delivered in the UK.” | Whether every stated constraint is respected, including price, form and market. |
| Product comparison | “Which of these two is gentler on a compromised barrier?” | Whether the comparison is supported by authoritative product information. |
| Compatibility | “Can I use this with the tretinoin I already use?” | Whether compatibility can be established from the product record. |
| Trade-off | “I would rather have tolerability than a faster result.” | Whether the agent resolves competing priorities in the customer's favour. |
| Current-model choice | “Is this the current formulation?” | Whether the current generation is recommended over an obsolete predecessor. |
| Market eligibility | “I am ordering from the UK.” | Whether the recommended product and destination are appropriate for the shopper's market. |
Wat elke Winkeltest vraagt, in volgorde.
Find, Answer, Trust en Close zijn de vier dingen die moeten kloppen om één klantbehoefte goed te laten aflopen. Een test die er drie haalt, eindigt nog steeds met een shopper die niet het juiste kan kopen.
Haalde de agent een passend en geschikt product op?
- verkeerde categorie
- verkeerde variant
- een beter product gemist
- product opgehaald dat niet geldig is in de markt
Kon hij de belangrijke vragen van de klant beantwoorden?
- productinformatie stelt niet vast welke vorm van het werkzame bestanddeel dit is
Hier hoort Agent-beantwoordbaarheid thuis.
Was de aanbeveling gebaseerd op goedgekeurde en actuele informatie?
- niet-onderbouwde productclaim
- onduidelijke productidentiteit
- onjuiste aangeleverde prijs
- beschikbaarheid klopt niet
- niet-goedgekeurde positionering
Kon de shopper een geldige aankoopbestemming bereiken?
- ongeldige product-URL
- ongeldige retailer-URL
- aangeleverde beschikbaarheid onjuist
- verkeerde regio
Close gaat over het bereiken van een geldige plek om te kopen: een werkende product-URL, een retailerbestemming, aangeleverde beschikbaarheid en de juiste regio. Herm maakt geen winkelmandjes aan, voert geen checkout uit en verwerkt geen betalingen.
Zie wat de agent overwoog, en waarom de uiteindelijke keuze slaagde of faalde.
Wie alleen het eindantwoord leest, mist de nuttigste fout: het product dat had moeten winnen en nooit werd opgehaald. Selecteer een kandidaat om de waargenomen actie te zien en de onafhankelijke kijk van Herm daarop.
Opgehaald bij de eerste zoekopdracht en daarna terzijde gelegd omdat het boven het genoemde prijsplafond lag.
Afwijzing terecht. £169.00 is meer dan de grens van £150 die de klant noemde.
Een zelfverzekerd antwoord kan toch commercieel verkeerd zijn.
Agents schrijven goed. Vloeiendheid is niet de succesmaat. Herm classificeert wat er mis was aan een aanbeveling, en dat vertelt een productteam waar het aan de slag moet.
The agent states the serum is fragrance-free without authoritative support in the product record.
TrustA prescription-strength retinoid recommended to someone using their first active.
Find · Brand IntentA product recommended that is not available in the shopper's geography.
Find · CloseCorrect serum family, an unbuffered form recommended to a customer who asked for gentle.
FindThe product choice is right and the purchase destination is broken or out of market.
CloseDe catalogus is niet de enige bron van waarheid.
Merken kunnen commerciële, wettelijke of positioneringsregels hebben die bepalen of een aanbeveling acceptabel is, ook wanneer de productkenmerken alleen die regels niet vastleggen.
Met Merkintentie leg je vast wat correct betekent voor jouw merk. Elke Winkeltest wordt daar vervolgens tegen beoordeeld, naast het productrecord.
Elke mislukte test laat zien wat kon worden onderbouwd, en wat niet.
Een oordeel dat je niet kunt inzien, is het niet waard om op te handelen. Elke bewering in de aanbeveling herleidt naar een productveld en de bron waar het vandaan kwam. Selecteer een rij om de keten te volgen.
The agent asserted the product is fragrance-free and the assertion holds against authoritative product information.
Beweringen worden vergeleken met gezaghebbende productinformatie die het merk aanlevert. De selectie van bewijs is eigendom van Herm.
Eén slechte aanbeveling kan een probleem in de hele catalogus blootleggen.
Herm groepeert terugkerende faalpatronen, zodat teams kunnen zien of een probleem bij één product, één familie of de hele catalogus hoort.
Vermeld de beoogde activiteit en pasvormbreedte gezaghebbend in de getroffen productrecords, met bewijs.
Herstel de productinformatie. Stel dezelfde klant de vraag opnieuw.
Zelfde behoefte van de shopper, zelfde categorie en markt, zelfde evaluatie. Opnieuw uitgevoerd zodra het productrecord verandert.
Productdata bijgewerkt: 214 producten, pasvormbreedte en beoogde activiteit goedgekeurd op 22 aug, automatisch hertest.
Dit is gemeten verbetering binnen de Product Readiness-evaluatie. Het is geen bewering over externe verkopen.
De catalogus verandert. De testsuite blijft vragen.
Product Readiness is doorlopende zekerheid, geen certificering bij lancering. Een test die vorige maand slaagde, slaagt niet meer wanneer een product, een prijs, een bestemming of de agentomgeving verandert.
Regressie. Er veranderde iets en een klantbehoefte werd niet meer vervuld.
Herstel. De oplossing hield stand toen dezelfde shopper terugkwam.
- 24 Jul New product introduced Velora Bright Boost C added to the suite baseline
- 28 Jul Availability changed Retinal Renewal out of stock · UK passed to failed
- 02 Aug Destination changed retailer URL redirect broke test 07 passed to failed
- 09 Aug Product information changed 34 variants updated in the connected source
- 10 Aug Regression detected 3 tests · vitamin C serums passed to failed
- 14 Aug Suite re-run 50 tests · 19 failed
- 22 Aug Product enriched, tests re-run fit width + intended activity approved · 214 products failed to passed
- 30 Aug Protocol environment changed feed requirement update · re-run, result restored restored
Gebouwd op een echte referentiearchitectuur voor commerce-agents.
De primaire simulatieomgeving van Herm gebruikt en breidt de open-source Commerce Agents-referentie-implementatie van Anthropic uit. Herm voegt daar zijn eigen catalogusweergave, het testen van shopperintenties, Merkintentie, onafhankelijke evaluatie, diagnose en hertesten aan toe.
Winkeltests zijn frameworkonafhankelijk. Dezelfde behoefte van een shopper kan in meer dan één agentomgeving worden uitgevoerd.
Anthropic is niet gelieerd aan Herm en onderschrijft Herm niet. Een testomgeving is niet de live consumentenervaring van welke assistent dan ook.
Een aanbeveling faalt vaak omdat de productinformatie de vraag van de klant niet kan beantwoorden.
Agent-beantwoordbaarheid brengt per familie in kaart welke beslissingsrelevante vragen je catalogus kan onderbouwen, nog voordat een shopper er één stelt.
Veelgestelde vragen
Wat is precies één Winkeltest?
Eén representatieve koopsituatie van een klant, van begin tot eind uitgevoerd: de behoefte, de agent die je catalogus doorzoekt en vergelijkt, de aanbeveling die hij doet, en een onafhankelijke beoordeling of die aanbeveling de klant heeft geholpen.
Ziet Herm de redenering van het model?
Nee. Herm beoordeelt waarneembaar gedrag: de toolacties die de agent uitvoerde, de producten die hij ophaalde en afwees, en de aanbeveling en uitleg die hij gaf. Verborgen modelredenering wordt niet gelezen en niet getoond.
Wie beslist of een test is geslaagd?
Herm, onafhankelijk van de agent. De winkelagent doet de aanbeveling; een aparte evaluatielaag beoordeelt die tegen gezaghebbend productbewijs en eventuele toepasselijke Merkintentie. De agent mag nooit zijn eigen werk nakijken.
Zijn dit echte klantvragen?
Het zijn representatieve koopsituaties, geen logs van letterlijke gebruikersvragen. Waar een intentie is afgeleid van waargenomen klantinput, vermeldt het resultaat dat.
Kunnen we dezelfde test in verschillende AI-systemen uitvoeren?
Ja. Winkeltests zijn frameworkonafhankelijk, dus dezelfde behoefte van een shopper kan in meer dan één agentomgeving worden uitgevoerd. Resultaten bevatten hun omgevingscontext, omdat verschillende omgevingen geen identieke experimentele omstandigheden zijn.
Zie wat er gebeurt wanneer AI in je catalogus winkelt.
Eén realistische klantbehoefte, van begin tot eind uitgevoerd, met het bewijs achter het oordeel.
Overal voorbeeldcijfers.