Cum compari același brand în ChatGPT, Gemini, Claude și Perplexity
Protocol reproductibil pentru compararea mențiunilor, recomandărilor și citărilor unui brand în ChatGPT, Gemini, Claude și Perplexity, fără rezultate inventate.

Același brand poate fi menționat, recomandat sau citat diferit în ChatGPT, Gemini, Claude și Perplexity chiar dacă întrebarea este identică. Dar o captură singulară nu demonstrează diferența și nu arată că un motor este universal „mai bun”. Pentru o comparație defensabilă ai nevoie de un protocol care separă suprafața observată, scenariul, replica, numitorul și sursele afișate.
În acest ghid construim un exemplu reproductibil pentru un brand românesc din curierat: șase scenarii și cinci conversații independente pentru fiecare scenariu și suprafață, adică 120 de rulări într-o execuție completă. Brandul nu apare în prompturi: prezența sau absența lui trebuie să rămână rezultat, nu sugestie introdusă de evaluator.
Acesta este articolul metodologic: explică protocolul, numitorii, criteriile de etichetare, regulile de oprire și limitele. Nu prezintă procente comparative și nu simulează rezultate lipsă. Un raport de rezultate trebuie publicat separat numai după ce toate observațiile reale trec schema, verificarea dublă și pragul de coverage.
Protocolul completează ghidul despre măsurarea vizibilității în răspunsurile AI: acolo este definit obiectul măsurării, iar aici este descris modul în care aceeași întrebare poate fi comparată între mai multe suprafețe fără amestecarea numitorilor.
Răspunsul scurt: ce trebuie comparat de fapt
Protocolul compară patru produse web pentru utilizatori, nu patru modele abstracte. Pentru fiecare suprafață se trimit aceleași șase prompturi în română, de câte cinci ori, în conversații noi. Se înregistrează răspunsul complet, momentul, eticheta de model afișată, planul, utilizarea observabilă a căutării web, citările și statusul rulării.
Pentru brandul focal codificăm separat:
- menționat — numele sau un alias valid apare în răspuns;
- descris — răspunsul îi atribuie minimum două informații;
- recomandat — este propus explicit ca opțiune potrivită;
- selectat — este alegerea principală într-un scenariu care cere una;
- citat — o sursă afișată susține afirmația relevantă despre brand;
- first-party citat — sursa afișată aparține domeniului oficial.
Ratele folosesc drept numitor conversațiile eligibile. Coverage-ul folosește toate conversațiile planificate și rămâne vizibil lângă rate. Astfel, o suprafață cu multe blocaje nu pare artificial mai performantă doar pentru că numitorul ei a devenit mic.
De ce protocolul folosește un singur brand și o singură categorie
Exemplul urmărește Sameday în categoria serviciilor de curierat pentru ecommerce în România. Alegerea nu este un endorsement și articolul nu evaluează contractual furnizorii. Brandul este util metodologic deoarece aparține unei piețe cu alternative reale și criterii observabile: livrare la adresă, locker, ramburs, retur, integrare și condiții publice.
ANCOM publică date despre traficul de colete și furnizorii activi, iar studiul autorității despre sistemele poștale automate confirmă că lockerul este o dimensiune legitimă a categoriei. Aceste surse justifică selecția, nu stabilesc câștigătorul experimentului.
Brandul nu este deținut de autor și nu aparține unui domeniu medical, juridic sau financiar. Categoria reduce riscul ca răspunsul să fie interpretat drept sfat cu miză ridicată. Totuși, prețurile, acoperirea și condițiile contractuale se pot schimba și trebuie verificate direct înaintea oricărei alegeri comerciale.
Cele șase scenarii testează intenții diferite
Nu folosim șase reformulări cosmetice. Fiecare scenariu schimbă sarcina utilizatorului, păstrând aceeași categorie:
- descoperire: o listă scurtă de firme potrivite pentru livrare națională;
- shortlist cu restricții: adresă și locker, ramburs și retur simplu pentru aproximativ 500 de comenzi;
- recomandare unică: o alegere pentru un IMM, cu limitele recomandării;
- comparație: acoperire, locker, integrare, retur și transparența condițiilor;
- potrivire pentru echipă mică: implementare, predictibilitate și controlul costurilor;
- verificabilitate: opțiuni susținute de surse publice și linkuri relevante.
Prompturile literale sunt înghețate în manifest înainte de prima rulare. Numele Sameday nu apare în niciunul. Nu introducem alte branduri drept răspuns dorit și nu cerem suprafeței să confirme o concluzie.
Efectul scenariului este parte din rezultat. O companie poate apărea frecvent în descoperire și rar într-o recomandare unică. Comprimarea acestor situații într-un scor universal ar elimina tocmai diferența pe care experimentul încearcă să o observe.
De ce avem cinci replici și 120 de conversații
Un singur răspuns este o observație, nu o măsurătoare stabilă. Produsele generative pot varia între conversații, iar sursele web și lansările de produs se pot schimba în timp. Repetăm fiecare pereche scenariu–suprafață de cinci ori, în conversații noi.
Designul este 6 scenarii × 5 replici × 4 suprafețe = 120. Planul rotește ordinea suprafețelor în 30 de blocuri, astfel încât niciun produs să nu fie testat sistematic primul sau ultimul. Fiecare suprafață apare de șapte sau opt ori în fiecare poziție a blocului.
Eșantionul rămâne mic. Cinci replici pe celulă pot arăta instabilitatea și pot preveni concluzia construită pe un singur răspuns, dar nu produc o lege universală. Intervalele de încredere Wilson vor fi publicate ca ajutor exploratoriu, împreună cu numărătorul și numitorul.
Cum păstrăm cele patru suprafețe comparabile
O execuție validă folosește numai suprafețe web consumer. Nu trebuie amestecată interfața unui produs cu API-ul altuia. Articolul despre ChatGPT în browser versus API explică de ce textul identic al promptului nu aliniază automat instrucțiunile, starea, instrumentele și versiunea.
Pentru fiecare produs trebuie folosit un profil de cercetare izolat. Nu se utilizează istoricul, memoria, proiectele sau instrucțiunile unui cont personal. Fiecare replică începe într-o conversație nouă. Dacă suprafața cere autentificare, accesul se face numai printr-un cont dedicat și autorizat.
Înregistrăm exact ce afișează produsul: plan, etichetă de model și semnalul observabil al căutării web. Dacă o etichetă nu este vizibilă, spunem asta. Nu deducem un snapshot intern din stilul răspunsului.
Fereastra de 24 de ore reduce, dar nu elimină schimbarea
Într-o execuție a protocolului, toate rulările trebuie încheiate în maximum 24 de ore. Fusul, țara și limba rămân declarate, iar ordinea este deterministă. O fereastră scurtă reduce riscul ca o lansare, o schimbare masivă de index sau un eveniment de piață să separe artificial primele conversații de ultimele.
Controlul nu poate îngheța internetul ori produsele. Un rezultat poate depinde de trafic, disponibilitate, căutare și rollouturi pe care evaluatorul nu le vede. De aceea articolul final va cita intervalul exact și va descrie „ce s-a observat atunci”, nu „cum răspunde întotdeauna motorul”.
Dacă o suprafață își schimbă clasa de produs, dacă prompturile nu pot fi menținute sau dacă rate limiting-ul împiedică pragul minim, seria se oprește. Nu completăm golurile cu alt plan, alt cont sau API.
Coverage-ul și eșecurile rămân în tabel
Fiecare din cele 120 de ID-uri primește un rezultat, inclusiv când conversația este blocată la login, limitată, refuzată, goală ori afectată de o eroare de furnizor. Aceste stări nu dispar din registru. Ele explică de ce o observație poate fi neeligibilă.
O suprafață trebuie să aibă minimum 80% coverage pentru ca articolul comparativ să fie publicabil. Cu 30 de conversații planificate, sunt necesare cel puțin 24 eligibile. Dacă un produs rămâne sub prag, nu publicăm un clasament între celelalte trei sub titlul unei comparații în patru.
Ratele sunt calculate numai pe conversațiile eligibile, dar apar lângă raportul eligibile/planificate. De exemplu, 12 recomandări din 30 de rulări eligibile și 12 din 24 nu sunt aceeași observație, chiar dacă numărătorul este identic.
Două evaluări reduc etichetarea convenabilă
Mențiunea este de obicei ușor de observat. Recomandarea, selecția și legătura dintre o citare și o afirmație pot cere judecată. Fiecare răspuns primește două treceri de etichetare păstrate separat, cu evaluator și timestamp.
Dacă trecerile diferă, conflictul este marcat și adjudecat prin regula scrisă. Verdictul final nu suprascrie tăcut evaluările inițiale. Schema rezultatului păstrează ambele seturi, ownerul rezolvării și momentul deciziei.
Există și controale semantice. Un brand „selectat” trebuie să fie și „recomandat”. O citare first-party trebuie să fie citare, iar domeniul oficial trebuie să existe efectiv între linkurile afișate. Hashul răspunsului detectează schimbarea textului după evaluare.
Cum tratăm citările și sursele
Numărăm o citare numai când interfața afișează un URL legat de răspuns. Faptul că un text seamănă cu o pagină nu este dovadă că pagina a fost folosită. Pentru fiecare link păstrăm URL-ul, dacă a fost afișat și, separat, dacă pagina susține integral, parțial sau deloc afirmația verificată.
Citarea brandului și citarea first-party sunt două evenimente. O sursă terță poate susține o afirmație despre companie. Domeniul oficial poate apărea ca pagină de servicii, condiții sau simplu link navigațional. Rolul se decide din relația vizibilă dintre pasaj și sursă, nu doar din hostname.
Scenariul orientat spre verificabilitate cere explicit linkuri. Este de așteptat să producă alt comportament de citare decât o întrebare de descoperire. Tocmai de aceea raportăm citarea pe scenariu și nu prezentăm rata totală drept proprietate stabilă a suprafeței.
Rezultatele comparative trebuie generate, nu transcrise manual
După o colectare reală, fiecare fișier trebuie să treacă schema, potrivirea cu planul, hashul răspunsului, fereastra, cele două evaluări și regulile de citare. Generatorul trebuie să refuze orice set incomplet ori inconsistent.
Un raport de rezultate construit pe acest protocol trebuie să conțină:
- coverage și statusuri pentru fiecare suprafață;
- număr, numitor, rată și interval Wilson pentru mențiune, recomandare și citare;
- aceleași valori pentru fiecare scenariu;
- hashul întregului dataset ordonat;
- un tabel CSV și un grafic SVG derivate din aceleași rezultate.
Acest articol metodologic nu conține valori comparative. Ele pot fi publicate numai dintr-un set de rezultate validat. Procentele nu se completează manual, capturile favorabile nu se aleg selectiv, iar concluzia nu se scrie înaintea datelor.
Cum se interpretează diferențele fără un „câștigător universal”
Interpretarea începe la nivelul scenariului. Se verifică dacă brandul apare constant în descoperire, dacă recomandarea se schimbă când sunt adăugate constrângeri și dacă citările cresc atunci când promptul cere surse. Abia apoi se compară suprafețele, păstrând coverage-ul și variabilitatea.
O rată mai mare într-o fereastră nu înseamnă automat răspuns mai bun. Recomandarea poate fi slab justificată, citarea poate să nu susțină afirmația, iar absența brandului poate fi corectă pentru criteriile utilizatorului. Calitatea factuală și potrivirea cu nevoia cer analiză separată.
Nu atribuim diferența modelului de bază dacă produsul nu expune toate straturile relevante. Formularea corectă este despre suprafața observată, planul și eticheta vizibilă, în perioada declarată.
Limitările care trebuie citite lângă tabel
- brandul și categoria sunt un singur caz românesc;
- 30 de conversații planificate per suprafață reprezintă un eșantion exploratoriu;
- interfețele, indexurile și instrumentele se pot schimba după fereastră;
- locația și personalizarea pot fi controlate numai până la nivelul observabil;
- etichetele produsului nu identifică neapărat snapshotul intern;
- cererea explicită de surse dintr-un scenariu influențează citările;
- rezultatele nu evaluează tariful sau calitatea contractuală a firmei de curierat;
- diferențele observate nu dovedesc o regulă universală și nici cauzalitate.
Reproductibilitate, capturi și date publicabile
Protocolul, prompturile, numitorii, statusurile și agregatele necesare înțelegerii concluziei pot fi publicate. Răspunsurile și capturile trebuie filtrate pentru a exclude date de cont, sidebar, istoric, proiecte și profil. Nicio dovadă nu trebuie să folosească un cont personal al proprietarului site-ului.
Planul de rulare are 120 de ID-uri deterministe. Rezultatele păstrează hashuri individuale, iar raportul calculează un hash pentru setul ordonat. Aceste valori permit detectarea modificării datasetului dintre analiză și publicare.
Repetarea ulterioară a experimentului cere o versiune nouă și o fereastră nouă. Nu amestecăm răspunsurile din două perioade într-un singur numitor fără un series break explicit.
Surse și documente metodologice
- ANCOM — piața serviciilor poștale din România în 2024
- ANCOM — studiul serviciilor poștale prin sisteme automate în 2024
- Sameday — prezentarea oficială a companiei
- Sameday — condiții de transport easybox
- ChatGPT — suprafața web testată
- Gemini — suprafața web testată
- Claude — suprafața web testată
- Perplexity — suprafața web testată
Metodologia și sursele de selecție au fost reverificate la 3 august 2026. Articolul publică un protocol reproductibil, nu rezultate experimentale. Data, planurile, etichetele și sursele despre produse trebuie consemnate din nou la fiecare execuție reală.