Înainte și după: ce putem demonstra despre vizibilitatea AI
O diferență observată, o schimbare persistentă și un efect atribuit nu sunt aceeași concluzie. Iată scara dovezii și formulările permise în rapoartele de vizibilitate AI.

O comparație înainte și după poate demonstra că rezultatul măsurat s-a schimbat în eșantionul observat. Singură, nu demonstrează că intervenția a produs schimbarea.
Dacă rata de recomandare crește de la 18% la 27% după ce publicăm conținut nou, putem raporta o diferență de 9 puncte procentuale. Ca să spunem mai mult, trebuie să arătăm că măsurarea este comparabilă, că diferența persistă, că nu urmează o schimbare generală a mediului și, pentru cauzalitate, că designul susține atribuirea.
Acest ghid pune concluziile pe patru trepte: schimbare observată, schimbare persistentă, diferență comparativă și efect cauzal estimat. Fiecare treaptă are propria formulare permisă și propriile limite.
1. „După” este o ordine în timp, nu o explicație
O intervenție editorială poate preceda o creștere fără să fie cauza ei. În aceeași perioadă se pot schimba modelul, interfața, indexul web, cererea, știrile, sursele disponibile, limba răspunsului sau metoda noastră de clasificare.
De aceea separăm trei propoziții care par asemănătoare, dar nu sunt:
- „rata măsurată a crescut după publicare” — observație;
- „creșterea este asociată temporal cu publicarea” — asociere;
- „publicarea a produs creșterea” — afirmație cauzală.
Google explică în documentația Search Console faptul că este dificil de stabilit dacă o modificare a paginii a cauzat direct o îmbunătățire, deoarece sentimentul public, evenimentele și alte site-uri se pot schimba simultan. Principiul este valabil și când observăm răspunsuri AI externe.
2. Mai întâi demonstrăm că măsurăm același lucru
O diferență numerică este interpretabilă numai dacă termenii comparației rămân compatibili. Păstrăm aceeași definiție a „mențiunii”, „citării” sau „recomandării”, aceeași unitate de analiză și aceeași regulă pentru răspunsurile ambigue.
Raportul trebuie să arate:
- numărătorul și numitorul, nu doar procentul;
- numărul de eșecuri, refuzuri și răspunsuri neclasificabile;
- prompturile sau scenariile incluse;
- motorul, suprafața, limba, geografia și perioada;
- versiunea rubricii și orice abatere de la protocol.
NIST AI RMF Playbook cere ca proxy-urile folosite să reprezinte constructul pe care pretind că îl măsoară. O rată de apariție a numelui nu poate fi redenumită „rată de recomandare” dacă rubricile nu verifică o recomandare reală.
3. Treapta 1: diferența observată
La primul nivel avem două ferestre comparabile și putem calcula diferența. De exemplu:
În cohorta de 120 de conversații comparabile, brandul a fost recomandat în 22 de răspunsuri înainte (18,3%) și în 32 după (26,7%): +8,4 puncte procentuale.
Această formulare este utilă deoarece spune ce, unde și cât s-a schimbat. Nu ascunde eșantionul și nu atribuie cauza. „Vizibilitatea a crescut cu 46%” ar suna mai spectaculos, dar variația relativă poate induce în eroare dacă nivelul inițial și numitorul lipsesc.
Pentru observații împerecheate — aceeași întrebare, în aceleași condiții, înainte și după — NIST descrie analiza diferențelor pereche. Identificarea unei diferențe nu transformă însă un sistem dinamic și necontrolat într-un experiment cauzal.
4. Treapta 2: diferența persistentă
O singură rulare favorabilă poate proveni din variabilitatea normală. Mai multe valuri post-intervenție, efectuate după o regulă declarată, pot arăta că schimbarea persistă în perioada observată.
Putem scrie: „Rata a rămas peste intervalul baseline-ului în trei valuri săptămânale, pe aceeași cohortă și în aceeași suprafață.” Nu putem scrie: „rezultatul este stabil permanent”. Persistența este delimitată de motor, configurație, limbă, scenarii și timp.
Dacă doar unul din patru valuri crește, concluzia corectă nu este „intervenția a funcționat o dată”, ci „nu am observat o îmbunătățire persistentă”. Dacă direcția diferă între motoare, raportăm rezultatele separat. Media poate ascunde un câștig și o pierdere simultană.
5. Treapta 3: diferența față de o comparație
Un grup comparabil care nu primește intervenția ne ajută să vedem dacă schimbarea este specifică paginilor tratate sau apare în întregul mediu. Dacă grupul intervenție crește cu 9 puncte, iar comparația crește cu 7, diferența comparativă este 2 puncte, nu 9.
Formularea permisă este: „cohorta tratată a crescut cu 2 puncte mai mult decât cohorta de comparație în fereastra declarată”. Încă trebuie să documentăm de ce grupurile sunt comparabile, dacă aveau evoluții similare înainte și dacă legăturile, traducerile sau alte modificări au contaminat comparația.
Un control slab nu produce cauzalitate puternică. El poate elimina unele explicații generale, dar poate introduce diferențe noi. Protocolul complet pentru baseline, intervenție, controale și ferestre este descris în ghidul despre măsurarea impactului unei intervenții GEO.
6. Treapta 4: un efect cauzal estimat
Rezervăm verbul „a produs” pentru un design care identifică efectul sub ipoteze explicite. Poate fi o alocare randomizată, un rollout eșalonat sau un design cvasi-experimental bine justificat. Analiza trebuie declarată înainte, iar abaterile și verificările de sensibilitate trebuie păstrate.
Chiar și atunci, concluzia are domeniu:
În cohorta și perioada testate, estimăm că bundle-ul editorial a crescut rata de recomandare cu X puncte, cu intervalul Y–Z, dacă ipotezele de comparabilitate și lipsă a contaminării sunt valabile.
Nu transformăm estimarea într-o garanție pentru orice pagină, limbă sau model. NIST AI RMF Core cere metode riguroase, incertitudine, comparații cu repere și documentarea limitelor de generalizare dincolo de condițiile evaluate.
7. Scara dovezii și limbajul permis

| Nivel | Ce putem spune | Ce nu putem spune încă |
|---|---|---|
| Diferență observată | „KPI-ul măsurat a fost mai mare după data X.” | „Schimbarea de conținut a produs creșterea.” |
| Diferență persistentă | „Creșterea s-a menținut în valurile și condițiile observate.” | „Efectul este permanent și general.” |
| Diferență comparativă | „Cohorta tratată a crescut cu X mai mult decât comparația.” | „Orice explicație alternativă a fost exclusă.” |
| Efect estimat | „Estimăm un efect X, în acest domeniu și sub aceste ipoteze.” | „Intervenția garantează același efect peste tot.” |
8. Incertitudinea schimbă sensul diferenței
O rată de 30% poate însemna 3 din 10 sau 300 din 1.000. Procentul este identic, precizia nu. Raportăm intervale potrivite tipului de metrică și designului, fără să folosim „semnificativ” ca sinonim pentru „mare” sau „important”.
NIST prezintă intervale pentru proporții, inclusiv metoda Wilson. Un interval face vizibilă precizia limitată; nu repară o cohortă nereprezentativă, o rubrică instabilă sau selectarea post-hoc a celor mai bune rezultate.
Separăm relevanța statistică de relevanța decizională. O diferență mică și precisă poate fi neimportantă comercial. O diferență mare, dar foarte incertă, poate justifica un test nou, nu o declarație publică definitivă.
9. Nu amestecăm metrici cu numitori diferiți
Impresiile și clickurile dintr-o platformă, sesiunile de referral și recomandările din conversații eșantionate răspund unor întrebări diferite. Google definește explicit impresiile, clickurile și CTR-ul pentru rapoartele sale. Aceste valori nu sunt recommendation share într-un set extern de răspunsuri AI.
Putem arăta trei panouri alăturate, fiecare cu sursa și numitorul său. Nu le adunăm într-un scor sintetic și nu folosim creșterea unuia pentru a pretinde că au crescut toate.
Aceeași disciplină este necesară între mențiune, citare și recomandare. Ghidul despre numitorii KPI-urilor AI explică de ce procentul nu poate fi interpretat fără populația eligibilă.
10. Anomaliile și schimbările externe rămân în raport
Un salt poate proveni dintr-un update al sistemului de logging, nu dintr-o modificare reală a comportamentului. Jurnalul oficial de anomalii Search Console arată exemple în care schimbările de agregare sau erorile produc artificial scăderi și creșteri în grafice.
Pentru vizibilitatea AI păstrăm un jurnal echivalent: schimbări de model sau interfață, indisponibilități, modificări ale cohortelor, știri, sezonalitate, indexare, canonicale, actualizări ale clasificatorului și date lipsă.
Nu eliminăm automat zilele incomode. Dacă o anomalie justifică excluderea, arătăm analiza principală conform planului și analiza de sensibilitate fără intervalul afectat. Cititorul trebuie să vadă impactul deciziei.
11. Rezultatul poate fi nul, mixt sau advers
„Nu am detectat o diferență” nu înseamnă neapărat „diferența este exact zero”. Poate însemna că estimarea este prea imprecisă sau fereastra prea scurtă. Spunem ce permite datele și dacă testul avea suficientă putere pentru pragul relevant.
Un rezultat mixt poate arăta mai multe citări, dar mai puține recomandări; îmbunătățire într-o limbă și scădere în alta; un câștig pe o suprafață și stagnare pe alta. Nu alegem doar indicatorul favorabil. Un rezultat advers rămâne vizibil și poate declanșa rollback ori investigație.
Regula este simplă: metrica principală și criteriul de decizie se stabilesc înainte de rezultat. Analizele apărute ulterior sunt exploratorii și produc ipoteze pentru următorul test.
12. Exemple de corectare a afirmațiilor
| Afirmație prea puternică | Variantă proporțională |
|---|---|
| „Articolul nou a dublat vizibilitatea AI.” | „În eșantion, rata a crescut de la 4/40 la 8/40 după publicare; designul nu izolează cauza.” |
| „Strategia funcționează pe toate motoarele.” | „Creșterea a persistat în motorul A; în B nu am detectat o schimbare clară.” |
| „Avem un uplift cert de 12%.” | „Estimarea punctuală este +12 puncte, cu intervalul și ipotezele raportate alături.” |
| „Traficul confirmă recommendation rate.” | „Referralul a crescut; recommendation rate a fost măsurată separat pe cohorta conversațională.” |
Corectarea nu slăbește rezultatul. Îl face auditabil și îl protejează împotriva unei concluzii care nu poate fi reprodusă.
13. Pachetul minim de dovadă
Un reviewer ar trebui să poată verifica afirmația fără să reconstruiască experimentul din conversații sau screenshoturi disparate. Pachetul minim conține:
- întrebarea și decizia pe care rezultatul le informează;
- definiția metricii, numărătorul, numitorul și excluderile;
- cohorta, motoarele, suprafețele, limba, geografia și ferestrele;
- snapshoturile înainte și după și versiunea intervenției;
- rezultatele brute, eșecurile și clasificările;
- valurile repetate și incertitudinea;
- comparația, dacă există, și riscul de contaminare;
- jurnalul anomaliilor și al evenimentelor concurente;
- planul inițial, abaterile și verificările de sensibilitate;
- concluzia permisă și lista explicită a lucrurilor nedemonstrate.
Ghidul pentru construirea baseline-ului de conținut descrie procesul separat. Baseline-ul care alimentează acest pachet trebuie înghețat înainte de editare.
14. Regula de decizie pentru raport
Înainte să publicăm concluzia, punem trei întrebări:
- Ce s-a observat exact? Cifre, numitori, ferestre și condiții.
- Ce explicații alternative reduce designul? Repetare, comparație, control sau identificare cauzală.
- Care este cea mai puternică propoziție susținută fără un salt logic?
Dacă răspunsul se oprește la „a crescut după”, raportul rămâne la treapta 1. Dacă avem mai multe valuri, urcăm la persistență. Dacă diferența rezistă față de o comparație credibilă, raportăm diferența comparativă. Numai un design cauzal defensabil permite atribuirea efectului.
Verdict
Comparația înainte și după nu este inutilă. Ea stabilește ce s-a schimbat și cu cât. Devine periculoasă numai când ordinea în timp este prezentată drept cauză.
Un raport bun urcă pe scara dovezii numai atât cât îi permit datele: observație, persistență, comparație, apoi — rar și condiționat — efect cauzal estimat. Arată numitorii, incertitudinea, anomaliile și domeniul concluziei. Când dovezile nu ajung, propoziția se scurtează; rezultatul nu se cosmetizează.
Surse
- NIST AI RMF Core — Measure
- NIST AI RMF Playbook — Measure
- NIST/SEMATECH — Analysis of paired observations
- NIST/SEMATECH — Confidence intervals for proportions
- Google Search Console — measuring the impact of page changes
- Google Search Console — data anomalies
- Google Search Console — performance metrics
Sursele au fost verificate la 2 august 2026. Articolul descrie un model editorial de raportare și nu afirmă că AYSA execută deja automat măsurarea, controlul sau estimarea cauzală.