SEO, GEO & AI

Corelație sau cauzalitate în optimizarea pentru AI

O creștere după publicare nu dovedește că intervenția a produs-o. Definim contrafactualul, graful cauzal, confounderii și designul care susține concluzia.

Colaj editorial cu două serii care se mișcă împreună și un mecanism separat care arată o posibilă relație cauzală
Două semnale pot urca împreună fără ca unul să-l fi produs pe celălalt; cauzalitatea cere un mecanism, un contrafactual și un design.

Dacă vizibilitatea unui brand crește după o intervenție GEO, putem raporta schimbarea. Nu putem spune automat că intervenția a cauzat-o. Între publicare și răspunsurile AI se pot schimba modelul, suprafața, indexul, cererea, sezonul, concurența, produsul și chiar definiția metricii.

Corelația nu este inutilă: descrie o asociere care merită investigată. Cauzalitatea răspunde însă la altă întrebare: ce s-ar fi întâmplat cu aceeași populație de pagini și scenarii, în aceeași perioadă, dacă intervenția nu ar fi avut loc? Acea lume alternativă este contrafactualul pe care designul încearcă să îl aproximeze.

1. Descrierea, predicția și cauzalitatea sunt întrebări diferite

O întrebare descriptivă cere cât a fost rata de recomandare. O întrebare predictivă cere ce rată anticipăm în următoarea fereastră. O întrebare cauzală cere cât s-ar schimba rata dacă am aplica o intervenție definită față de o alternativă definită. Același tabel poate fi util pentru toate trei, dar nu identifică singur răspunsul cauzal.

NIST separă corelația de cauzalitate: în prima, variabilele se modifică împreună; în a doua, schimbarea uneia produce schimbarea celeilalte. Volumul mare de date poate face asocierea foarte precisă fără să elimine o explicație alternativă.

2. Formulăm întrebarea ca o intervenție

„Conținutul mai bun crește vizibilitatea AI?” nu definește un tratament. Înlocuim întrebarea cu una operațională: care este efectul publicării modulului verificat X și al legăturilor interne Y, pe clustere eligibile, comparativ cu publicarea amânată, asupra ratei de recomandare în cohorta Z, la 30 de zile după disponibilitatea verificată?

Contractul conține unitatea de alocare, versiunea intervenției, comparatorul, rezultatul, populația, orizontul și mecanismul de alocare. Dacă schimbăm simultan textul, schema, navigarea, produsul și campania PR, tratamentul este un pachet. Nu atribuim retrospectiv efectul unei singure componente.

3. Contrafactualul nu poate fi observat direct

Pentru aceeași pagină și aceeași perioadă nu putem observa simultan rezultatul cu intervenția și fără ea. Observăm unul dintre cele două rezultate potențiale. Designul folosește alte unități, alte momente sau un model al seriei pentru a aproxima rezultatul lipsă.

Randomizarea face grupurile comparabile în medie prin mecanismul de alocare. Un grup de control ales după rezultat, în schimb, poate semăna doar superficial. În date observaționale, contrafactualul depinde de ipoteze despre ce variabile au influențat tratamentul și rezultatul.

4. Estimandul spune ce efect încercăm să estimăm

Estimandul nu este formula statistică, ci ținta. Putem estima efectul mediu total în toate scenariile eligibile, efectul în clusterele tratate, efectul la 30 de zile sau diferența între două pachete editoriale. Fiecare cere alte date și alte ipoteze.

Declarăm și rezultatul: mențiune, citare, recomandare, acuratețe sau alt eveniment cu numitor fix. Un efect asupra citării nu este automat efect asupra recomandării. Un efect total include căile prin crawl, indexare și preluarea sursei; un efect direct ar încerca să excludă o parte din aceste căi și răspunde la altă întrebare.

5. Graful cauzal face ipotezele inspectabile

Un graf aciclic direcționat—DAG—folosește săgeți pentru relațiile cauzale presupuse. Nu este o hartă a corelațiilor și nu dovedește săgețile. Forțează echipa să spună ce crede că produce intervenția, rezultatul și selecția în analiză înainte de a alege variabilele de ajustare.

Cursul Harvard despre diagrame cauzale formulează exact rolul lor: traduc expertiza într-un graf, ajută identificarea biasurilor și ghidează analiza. Două echipe care desenează grafuri diferite au ipoteze diferite, chiar dacă folosesc aceeași regresie.

6. Harta pentru o intervenție de conținut

Diagramă cu tratament, rezultat, confounder, mediator și collider, plus limbajul permis de fiecare design
Model operațional Dosinescu.ro: graful face ipotezele vizibile, iar designul limitează cât de cauzal poate fi formulat rezultatul.

În hartă, T este intervenția, Y rezultatul de vizibilitate, M mecanismul intermediar—descoperire, indexare și preluare în surse—iar U reunește cauze comune precum prioritatea comercială, vizibilitatea anterioară, sezonul sau o schimbare de platformă. S reprezintă selecția într-un subset post-tratament.

Traseul dorit este T → M → Y, eventual alături de alte căi T → Y. Traseul T ← U → Y este ne-cauzal și poate produce asociere chiar fără efect al intervenției. Selectarea numai a observațiilor cu S=1 poate deschide o cale nedorită când atât tratamentul, cât și rezultatul influențează selecția.

7. Confounderul este o cauză comună, nu orice variabilă corelată

O variabilă de confuzie—confounder—afectează alocarea tratamentului și rezultatul. Echipa poate alege pentru optimizare paginile care tocmai au avut un scor neobișnuit de mic. Vizibilitatea anterioară influențează astfel tratamentul și, prin regresie la medie, rezultatul ulterior.

O actualizare de produs poate declanșa atât rescrierea conținutului, cât și noi recomandări. Sezonul poate schimba prioritățile editoriale și cererea. Causal Inference: What If descrie confoundingul ca lipsă de exchangeability și arată în DAG traseul „backdoor” creat de cauza comună.

8. Mediatorul aparține mecanismului efectului

Intervenția trebuie publicată, descoperită, recrawl-uită, indexată sau preluată într-o sursă înainte să poată influența un răspuns. Aceste stări pot fi mediatori. Dacă vrem efectul total al intervenției, ajustarea pentru mediator poate bloca exact calea pe care încercăm să o măsurăm.

Putem analiza separat mecanismul, dar atunci definim un estimand de mediere și ipoteze suplimentare. Nu introducem automat în regresie „pagina a fost citată” dacă citarea este produsă de intervenție și conduce la rezultat. Asta nu este control pentru un confounder preexistent.

9. Colliderul poate crea o asociere care nu exista

Un collider este o variabilă influențată de două alte variabile. De exemplu, includerea în analiza „răspunsurilor cu citări” poate depinde și de intervenție, și de tipul rezultatului generat. Dacă analizăm numai acest subset, condiționarea poate asocia artificial tratamentul cu rezultatul.

La fel, selectarea numai a interogărilor unde o funcție AI s-a declanșat poate depinde de complexitatea întrebării și de mediul platformei. Lucrarea arhivată de CDC despre DAG-uri explică rolurile confounderilor, mediatorilor și colliderilor și cum ajustarea nepotrivită poate introduce bias.

10. „Ajustăm pentru tot” este o regulă periculoasă

O regresie cu toate coloanele disponibile poate controla un confounder util, poate bloca un mediator, poate deschide un collider și poate include o variabilă măsurată după tratament. Coeficientul devine dificil de interpretat chiar dacă software-ul returnează multe zecimale.

Alegerea setului de ajustare pornește din întrebare, timp și graf. Variabilele pre-tratament nu sunt toate obligatorii, iar variabilele post-tratament nu sunt toate interzise; rolul lor depinde de estimand. Documentăm motivul pentru fiecare ajustare și prezentăm specificații alternative justificate, nu „model shopping”.

11. Cronologia nu elimină cauzalitatea inversă

Intervenția are loc după ce echipa observă un declin. Declanșatorul tratamentului este deci rezultatul anterior sau o predicție despre rezultat. Dacă seria revenea natural, atribuirea recuperării intervenției supraestimează efectul.

Înghețarea regulii de eligibilitate și a momentului de tratament înainte de valul următor reduce această problemă. Baseline-ul înainte de modificare trebuie să includă mai multe valuri și variația naturală, dar baseline-ul singur nu creează contrafactualul.

12. Randomizarea este puternică, dar unitatea contează

Dacă putem eșalona intervenția, alocăm aleator clustere eligibile la publicare imediată sau întârziată. Blocăm după factori importanți—limbă, tip de pagină, vizibilitate inițială—și randomizăm în interiorul blocurilor. NIST descrie randomized block designs drept experimente în blocuri omogene, cu factorul de interes variat în interiorul lor.

Pagina poate fi o unitate greșită. Legăturile interne, navigarea și claritatea entității pot transmite efectul către paginile „control”. Atunci randomizăm clustere suficient de separate sau estimăm explicit spillover-ul. Randomizarea nu repară interferența ignorată, neaderarea, pierderea diferențială de observații sau schimbarea metricii.

13. Difference-in-differences scade schimbarea comună

Când randomizarea nu este disponibilă, putem compara schimbarea unui grup tratat cu schimbarea unui grup comparabil. În exemplu, rata tratată crește de la 20% la 32%, adică +12 puncte procentuale. Grupul de comparație crește de la 18% la 25%, adică +7 puncte.

Grup Înainte După Schimbare
Tratat 20% 32% +12 pp
Comparație 18% 25% +7 pp

Estimarea difference-in-differences este (32−20) − (25−18) = +5 pp. Schimbarea brută de +12 pp include și mișcarea comună de +7 pp. Cei +5 pp sunt o estimare comparativă, nu o garanție cauzală.

14. Trendurile paralele sunt o ipoteză, nu un checkbox

World Bank DIME descrie DiD ca metodă cvasi-experimentală și leagă validitatea de trendurile netratate paralele. Schimbarea controlului trebuie să reprezinte contrafactualul schimbării tratatului în absența intervenției.

Mai multe perioade pre-tratament permit examinarea trendurilor și un event study, dar nu pot dovedi ce s-ar fi întâmplat după. O actualizare de platformă care afectează diferit limbile, o campanie numai în grupul tratat sau contaminarea controlului încalcă ipoteza. Raportăm graficele pre-trend, calendarul co-intervențiilor și sensibilitatea la grupul de comparație.

15. Seriile întrerupte și controalele sintetice modelează contrafactualul

Cu suficiente valuri înainte și după, o serie temporală întreruptă poate estima o schimbare de nivel sau trend față de traiectoria așteptată. Un control sintetic combină serii neafectate pentru a aproxima mai bine traiectoria tratată. Ambele sunt mai puternice decât două puncte înainte/după, dar depind de stabilitate și specificarea modelului.

Brodersen și colaboratorii propun un model Bayesian structural time-series pentru causal impact, cu tendințe, sezonalitate și covariate contemporane. Interpretarea cauzală presupune că seriile de control nu sunt afectate de intervenție și că relația pre-intervenție oferă un contrafactual credibil.

16. Placebo-urile și controalele negative atacă explicații alternative

Aplicăm o dată placebo înainte de intervenția reală: dacă „efectul” apare și acolo, modelul captează probabil trendul sau sezonalitatea. Folosim rezultate negative care nu ar trebui afectate și pagini fără legătură, dar expuse acelorași schimbări de platformă. Repetăm analiza cu grupuri de comparație plauzibile și fără scenarii dominante.

Aceste teste nu demonstrează singure cauzalitatea. Ele încearcă să falsifice explicații. O analiză care supraviețuiește mai multor teste devine mai credibilă numai dacă designul identifică efectul și testele sunt relevante pentru amenințările reale.

17. Incertitudinea nu corectează biasul

Un interval îngust în jurul unei estimări confounded oferă precizie pentru o țintă greșită. Separăm incertitudinea de eșantionare de incertitudinea structurală: ipoteze despre control, selecție, expunere, spillover și stabilitatea platformei.

CDC amintește că o asociere observată poate proveni din cauzalitate, șansă, bias de selecție, bias informațional sau confounding. Raportăm intervalul, dar și ce surse de bias nu sunt cuantificate. Un p-value nu este un certificat de identificare.

18. Limbajul raportului urmează designul

Pentru o corelație transversală spunem „a fost asociat cu”. Pentru un înainte/după spunem „a crescut după”. Pentru valuri repetate spunem „diferența post-intervenție a persistat”. Pentru DiD spunem „estimarea comparativă este +5 pp sub ipotezele declarate”. Pentru un rollout randomizat putem spune „efect cauzal estimat în acest eșantion”, cu limitele de aderență, interferență și măsurare.

Scara dovezii pentru comparațiile înainte și după deține formulările generale. Aici adăugăm motivul: fiecare propoziție implică un contrafactual și ipoteze pe care designul fie le susține, fie nu.

19. Fișa minimă de identificare cauzală

  • întrebarea cauzală, tratamentul și comparatorul;
  • unitatea de alocare și populația eligibilă;
  • rezultatul, numitorul și orizontul;
  • estimandul total sau direct;
  • DAG-ul versionat și expertiza folosită;
  • mecanismul de alocare și factorii de blocare;
  • confounderii pre-tratament și setul de ajustare;
  • mediatorii și selecțiile post-tratament;
  • ipoteza de interferență și auditul spillover-ului;
  • calendarul platformei și co-intervențiilor;
  • analiza principală, intervalele și missingness-ul;
  • pre-trenduri, placebo-uri și controale negative;
  • limbajul permis și concluziile excluse.

Protocolul operațional complet pentru release, cohortă, controale și raportare rămâne în ghidul despre măsurarea impactului unei intervenții GEO. Fișa cauzală se atașează acelui protocol, nu îl înlocuiește.

Verdict

Corelația spune că două lucruri s-au mișcat împreună. Cauzalitatea cere să definim ce am schimbat, față de ce alternativă, pentru ce unități și perioadă, apoi să construim un contrafactual credibil. Graful previne ajustările greșite, iar designul limitează afirmația. În exemplu, +12 puncte devin +5 după controlul schimbării comune; numai ipotezele și verificările pot spune dacă acel +5 este un efect cauzal estimat sau doar o comparație mai bună.

Surse