ENDASV · soonNO · soon

JOURNAL

Claude commerce agents: de tre ting, du selv kan tjekke

Hvem der udfører skrivningen, hvor mange agenter der er, og hvem der bestemmer, hvornår den ruller ud. Tre beslutninger, du kan efterprøve på et tilbud, uden at nogen læser kode.

3. september 2026·11 min læsning·Claude · Anthropic · AI-agenter · e-handel · commerce agents · AI til virksomheder

Claude commerce agents blev generelt tilgængelige den 2. september 2026, og Anthropic lagde hele blueprintet frem samme dag.

En kunde beder om en refusion. Agenten læser ordren og regner ud, at refusionen er berettiget. Den kan stadig ikke udbetale pengene, fordi skrivningen bliver udført af noget, modellen ikke styrer.

Afvisningen er selve designet. Anthropic har bygget blueprintet sådan, at udbetalingen sker uden for modellen.

Tre af beslutningerne i det design kan du efterprøve på et tilbud, før du skriver under: hvem der udfører skrivningen, hvor mange agenter der er, og hvornår agenten må sættes i drift. Ingen af dem kræver, at nogen læser kode.

Agenten arbejder i din egen webshop, på dit eget katalog

Refusionen sker inde i en agent, du selv bygger, på dit eget katalog. Claude commerce agents er navnet på det, Anthropic har lagt frem.

Det, Anthropic har udgivet, er et blueprint, som alle kan hente. Blueprintet indeholder to agenter. Den ene er en shopping-agent. Den søger i kataloget, håndterer forespørgsler på flere varer, sammenligner dem, samler kurven og klarer kundeservicen i samme samtale. Den anden er en merchant-agent, der laver salgsanalyser, holder øje med lagerbeholdningen, foreslår priser og skriver udkast til kampagner.

Der ligger færdige implementeringer til fire brancher: detailhandel, rejser, telekom og billetsalg. Blueprintet kan køre på Messages API, Agent SDK eller Claude Managed Agents, som er i beta, og det kan sættes op på Claude API, Amazon Bedrock, Microsoft Foundry og Google Cloud Vertex AI. Wix fortæller selv, at de havde en agent oppe at køre på et kvarter.

Generelt tilgængelig vil her sige, at der ikke er nogen venteliste, og at man ikke skal ansøge om adgang. Koden er offentlig, og de mønstre og indbyggede sikringer, Anthropic har udgivet sammen med den, ligger der også. For en dansk webshop er spørgsmålet nu, hvem der skal bygge det, og hvad de skal kunne svare på undervejs.

Det er også merchant-agenten, der gør det relevant for virksomheder, som aldrig kommer til at sætte en agent foran deres kunder. Salgsanalyser, lagerstyring og kampagneudkast er internt arbejde, og det er den halvdel af blueprintet, der ligner det, de fleste faktisk har brug for først.

Så er der to ting, udmeldingen ikke siger.

Det er et blueprint til at bygge din egen agent på dit eget katalog, ikke agenter, der besøger andres webshops.

Visa og Mastercard er nævnt som "solutions partners", og det er den rolle, udmeldingen giver dem. En agentisk betalingsinfrastruktur ville kræve sin egen udmelding med sin egen mekanik.

Det er målingerne, du kan bruge

Udmeldingen har to tal. Kurvene bliver op til 35 procent større, og kunderne er 60 procent mere tilbøjelige til at gennemføre et køb. Anthropic tilskriver begge tal detailhandlere, der kører shopping-agenter på Claude. Der står ikke, hvor mange det er, hvor længe de har målt, eller hvad de solgte.

Guiden har andre tal, og dem kan du bruge til noget. Anthropic anbefaler 50 til 100 testtilfælde per brugerflow som udgangspunkt, og modelvalget bliver afgjort af sweeps.

Der kommer to spørgsmål ud af det, og du kan stille dem begge i et møde uden selv at have teknisk baggrund. Hvor mange testtilfælde har I bygget per flow. Og hvilke modeller har I kørt sweep på, op mod hvilket sæt.

Et tilbud, der kan svare på begge, er bygget af nogen, der har målt. Et brugbart svar lyder som et tal og et sæt: så mange tilfælde per flow, kørt op mod de her modeller, og her er, hvad der kom ud af det. Et svar, der bliver ved med at handle om, hvor dygtig modellen er, har ikke været i nærheden af et testsæt.

Modellen foreslår, harnesset udfører

Du sidder sandsynligvis med et spørgsmål om persondata. Det har et svar, og det står nedenfor. Blueprintet er bygget op omkring en risiko mere: den uigenkaldelige skrivning.

Tre eksempler fra guidens egen liste over, hvad der skal ende hos noget andet end modellen. En pris, der bliver ændret på tværs af et katalog. En ordre, der bliver oprettet på et opdigtet ID. En markedsføringskampagne, der går ud.

Det er den samme klasse hver gang: en handling, der ikke kan trækkes tilbage, når den først er sket. En forkert formulering i et svar kan rettes i næste sætning. En pris, der er slået igennem på tusind varenumre, skal et menneske rulle tilbage, og imens har kunderne set den.

Anthropic lægger sikringen i selve maskineriet. En godkendelsesflade, der findes. ID'er, som serveren udsteder. Skrivninger, der står i kø. Det er egenskaber ved systemet, og egenskaber kan du kigge efter. En instruktion i en prompt kan man læse højt på et møde. En godkendelsesflade skal nogen kunne åbne og pege på, mens du står der.

Den her artikel handler om at se på, hvad nogen allerede har bygget. Det er et andet arbejde med andre spørgsmål end at beslutte, hvad en agent selv må gøre. Den beslutning skrev jeg om i Grænsen for, hvad Claude må gøre selv.

Tospaltet stationstabel med fem rækker, der viser, hvem der holder en ordre på vejen ind. Kunden beder om varen, modellen sender et forslag videre, serveren udsteder det ID, skrivningen kræver, godkendelsesfladen er der, hvor en person eller en politik siger ja, og harnesset gennemfører betalingen. De to nederste rækker har en rød kant, fordi en køber kan se dem udefra uden en udvikler.
Det er vejen ind. Refusionen sidst i artiklen løber den anden vej, og den tegner du selv.

Der er fem egenskaber at gå efter. To af dem kan du selv efterprøve uden en udvikler ved bordet.

Findes der en rigtig godkendelsesflade. Anthropic beskriver den konkret: en knap i operatørens portal, en bekræftelse i kommandolinjen. Bed om at få den vist. En flade, ingen kan pege på, findes ikke.

Kan kunderne se og slette det, agenten har gemt om dem. Anthropic lægger langtidshukommelsen i en database uden for modellen, trækker oplysningerne ud asynkront, så det ikke koster ventetid, og skriver, at brugerne skal kunne se og slette det, der er gemt. Det er også svaret på persondataspørgsmålet ovenfor.

De tre andre kræver, at nogen med teknisk indsigt kigger med. Hver af dem har noget konkret, man kan pege på.

Serveren udsteder ID'erne. Skriveværktøjet tager kun imod ID'er, serveren selv har udstedt, så et opdigtet ID aldrig når frem til en skrivning. Det, du beder om at se, er værktøjets skema. Der skal ikke være et frit tekstfelt til et ID.

Tekst udefra bliver hegnet ind. Indhold fra tredjepart bliver renset og markeret, før modellen ser det. Bed om at se, hvor teksten kommer ind, og at den bliver markeret som data.

Skrivninger står i kø. De bliver serialiseret, så to skrivninger ikke kan være i gang på den samme ordre samtidig. Bed om at se, hvad der sker, hvis to medarbejdere trykker på samme sekund.

Leverandøren bør kunne sige, hvilket af de tre design de har testet

Der blev bygget tre design til det her job, og Anthropic kørte alle tre på sit eget commerce-arbejde. Én agent med skills klarede sig bedst, foran det design, hvor alt ligger i én prompt, og det, hvor flere subagenter deler opgaven imellem sig.

Anthropic offentliggør ikke, hvad testen målte. Det er deres egen test på commerce-området, kørt af dem, der bygger modellen.

Derfor mener jeg, at en leverandør, der tilbyder dig flere samarbejdende agenter, skal kunne navngive det design, de selv har testet, og sige, hvad de målte.

Både du og leverandøren kan bruge den sammenligning, og det er nok til at ændre, hvad mødet handler om.

Guiden har et tal mere, der gør spørgsmålet konkret. Anthropic lægger en skill i systemprompten, når den er relevant for en tredjedel af trafikken eller mere. Spørg, hvad der ligger i systemprompten hos dig, og hvorfor lige det. Svaret fortæller dig, om nogen har set på, hvad dine kunder rent faktisk spørger om, eller om alt bare er lagt ind.

Tre design stillet op. Øverst i fuld bredde og med rød kant: én agent med skills, som klarede sig bedst. Nedenunder to lige store kort ved siden af hinanden: subagent-design og én prompt til det hele, begge mærket "sammenlignet".
Kommer to leverandører hver med et af de to nederste, giver kilden dig ikke noget at skille dem ad med.

Nogen ejer agenten, og release-kalenderen følger med

Anthropic behandler agenten som én enhed, der bliver sat i drift under ét, og det har tre konsekvenser, du kan spørge til.

Ejerskabet følger systemejerskabet. Det team, der ejer søgningen, ejer også søgeværktøjet og den skill, der bruger det. Det lyder banalt, indtil nogen skal svare på, hvem der ejer agenten i en virksomhed med tyve ansatte. Spørg, hvem det er hos dig, mens der er ro til at svare.

Der køres CI, før noget bliver rullet ud. Anthropic kører CI på testtilfældene for kernetrafikken plus naboerne til det, der lige er ændret. Det er den samme slags testtilfælde som før.

Udrulningen starter småt. Canary vil sige, at ændringen først går ud til en lille del af trafikken og bliver udvidet, hvis den opfører sig ordentligt. Det er den samme idé som at lade en ny medarbejder tage de første ti samtaler, mens en kollega lytter med, og det forudsætter, at nogen rent faktisk lytter med på de første ti.

De tre ting hænger sammen på en måde, der er let at overse. Ejerskabet afgør, hvem der kigger på canary-udrulningen, og testtilfældene, hvad de kigger efter. Om de overhovedet har tid, står i kalenderen. Falder en af de tre ting bort, kan de to andre ikke bære det alene.

Og der er perioder, hvor ingen rører agenten. Anthropic anbefaler at fryse ændringer hen over højsæsonerne. For en webshop er det som regel de uger, der bærer årets omsætning, og det er også de uger, hvor en agent, der pludselig opfører sig anderledes, koster mest.

Spørg hvem, inden december.

Årsstrimmel med tolv felter. Hvert felt bærer månedens navn og en prik, der markerer et deployvindue. Under strimlen står to nøglelinjer: en grå prik for et deployvindue og en rød markør for din højsæson, altså de uger, du selv udpeger.
En udrulning, der starter småt, kræver stadig en uge, hvor nogen kigger med.

Følg én refusion

Jeg sporer den refusion, artiklen begyndte med. Seks trin.

  1. Kunden beder om en refusion.
  2. Agenten læser ordren og regner ud, at refusionen er berettiget.
  3. Værktøjet bliver kaldt med et ID, serveren har udstedt.
  4. Forslaget stiller sig i kø.
  5. En person eller en politik godkender det.
  6. Harnesset udfører skrivningen, og pengene bliver udbetalt.

Trin fem er det eneste sted, hvor noget andet end modellen skal sige ja. Det er den godkendelsesflade, jeg bad dig kigge efter længere oppe.

Gør nu det samme med din egen mest uigenkaldelige handling. Vælg selv: en prisændring, en kreditnota eller en kampagne, der går ud. Skriv trinnene ned, fra beslutningen bliver truffet, til pengene eller varen skifter hænder, og sæt en markering ved det trin, hvor et menneske eller en politik skal godkende handlingen.

Og navngiv fladen. Hvad hedder den, hvem trykker, og hvor sidder knappen.

Finder du ingen flade, er det svaret. Så er det den, der skal bygges først.

Det er den slags gennemgang, jeg laver, når jeg starter med en uges revision af, hvordan et team faktisk arbejder, før der bliver bygget noget. Det ligger under interne AI-værktøjer.

Kilder

Anthropic: Building commerce agents with Claude (2. september 2026)

Anthropic: A guide to the anatomy of effective commerce agents (2. september 2026)

Blueprintet på GitHub: anthropics/commerce-agents

Hvem lavede det her

FAQ

Ofte stillede spørgsmål

Det er en Claude-agent, der arbejder i din egen webshop, på dit eget katalog. Anthropics blueprint indeholder to agenter. En shopping-agent søger i kataloget, håndterer forespørgsler på flere varer, sammenligner dem, samler kurven og klarer kundeservicen i samme samtale. En merchant-agent laver salgsanalyser, holder øje med lagerbeholdningen, foreslår priser og skriver udkast til kampagner.

Ikke i det design, Anthropic selv anbefaler. Guiden siger, at ordreoprettelse, betalinger, refusioner, prisændringer og kampagner alle skal ende i en handling, som harnesset styrer, og harnesset er et andet system end modellen.

Selve blueprintet koster ingenting. Du betaler for modelforbruget. Anthropic offentliggør ingen pris på selve implementeringen, så resten af regnestykket er din leverandørs timer og dit eget forbrug.

Anthropic sammenlignede tre design og skriver, at én agent med skills klarede sig bedst, bedre end både én prompt til det hele og et subagent-design. Der er hverken offentliggjort et benchmark eller et måltal. Spørg din leverandør, hvilket af de tre de har testet, og hvad de målte.

Blueprintet er gratis at hente. Det ligger åbent på GitHub under anthropics/commerce-agents, sammen med mønstre og de indbyggede sikringer, og licensen på repoet er der, hvor du får det endelige svar på, hvad du må bruge koden til i din egen shop.

Blueprintet kan sættes op på Claude API, Amazon Bedrock, Microsoft Foundry og Google Cloud Vertex AI. Hvor data ligger, afhænger af den platform, du vælger. Udmeldingen tager ikke stilling til, hvor data opbevares, så det spørgsmål hører hjemme hos platformen.

Bed om at få godkendelsesfladen vist, den knap eller den bekræftelse, hvor et menneske eller en politik siger ja til en uigenkaldelig handling. Bed om at se, at en kunde kan se og slette det, agenten har gemt. Og bed om at se skriveværktøjets skema, hvor der ikke skal være et frit tekstfelt til et ID.

Denne udmelding handler om den agent, en virksomhed selv bygger på sit eget katalog. Agenter, der besøger andres webshops, er et selvstændigt emne, og hverken udmeldingen eller guiden behandler det.

Dette arbejde er udarbejdet i samarbejde med AI. Overordnet: AI cirka 85 procent, Kim cirka 15 procent. Ser man kun på produktionen, er det AI cirka 96 procent og Kim cirka 4 procent. Det er et kvalificeret skøn og ikke en målt log.

AI-andelen er højere end på de seneste opgaver, hvor den lå mellem 71 og 77 procent, og grunden er ikke, at noget blev bedre. Kørslen var uovervåget og foregik om natten, så den del, Kim normalt fylder mest i, nemlig at læse med og fange fejl undervejs, skete ikke. QA-gatene fangede det i stedet, og gatene er også AI.

Tabel med ni faser i arbejdet. Hver række viser fasens andel af det samlede arbejde, hvor stor en del AI lavede, hvor stor en del Kim lavede, og en kort begrundelse for vægtningen. Nederst en totalrække: AI 85 procent, Kim 15 procent.
Faserne er dem, der faktisk skete, inklusive seks runder på billederne og tre bekræftende runder på sproget.

Få nye essays på mail.

Cirka to gange om måneden. Samme stemme. Ingen listeudlejning, ingen retargeting.

Tilmeld dig Brinviks journal. Afmeld når som helst. Se vores privatlivspolitik.

Beskyttet af Cloudflare Turnstile. Ingen challenge, ingen CAPTCHA. Brinvik deler aldrig din adresse.