Ćaskanje sa četbotom završilo na Google: Ovaj AI model traži posebnu kontrolu privatnosti, šta morate uraditi

Vreme čitanja: oko 4 min.

Foto: Shutterstock

Sumirano

  • Neka ćaskanja sa chatbot Claude kompanije Anthropic su bila dostupna putem veb pretrage
  • Problem je otkriven kada su korisnici pronašli deljena ćaskanja putem pretraživača
  • Antropik koristi robots.txt da spreči indeksiranje, ali bez "noindex" oznake, stranice mogu biti indeksirane

Ono što se dešava između vas i AI četbota ne ostaje uvek samo između vas i četbota. Pitajte Gugl. Tokom vikenda, ljudi su bili iznenađeni kada su otkrili da se neka ćaskanja sa Antropikovim (Anthropic) Klodom (Claude) mogu lako pronaći putem veb pretrage. Problem, koji je izgleda prvi primetio jedan korisnik Redita, izložio je ćaskanja u kojima su ljudi tražili savete o tome kojoj političkoj stranci treba da se pridruže, da li su advokati u Kanzasu dužni da sami prijave kada veruju da su počinili etički prekršaj, kao i erotsko igranje uloga.

Klod omogućava korisnicima da sa drugim ljudima dele "snimke" ćaskanja kreiranjem javnog URL-a za određenu nit sa četbotom. Razlozi zbog kojih su neki od ovih URL-ova indeksirani od strane velikih pretraživača svode se na osnovne funkcije veb sajtova, pretraživača i spajanja to dvoje kada se u priču uključi generativna veštačka inteligencija.

U suštini, Antropik daje instrukcije veb krawlerima, poput onih koje koriste pretraživači kao što su Gugl i Bing, da ne indeksiraju ćaskanja koja korisnik odluči da podeli sa drugim ljudima. Kompanija to radi putem nečega što se zove robots.txt datoteka, što se dugo smatralo standardnim načinom da se veb skraperima kaže koji delovi sajta su prikladni za pristup. Antropikov robots.txt je učinio "deljena" ćaskanja nedostupnim za veb skrapere najmanje od septembra 2025. godine, prema snimku na Vejbek Mašini (Wayback Machine).

Ali sprečiti stranice da budu uključene u rezultate pretraživača teže je nego što biste očekivali.

Bing, koji i dalje prikazuje "oko 612 rezultata" ako pretražujete "site:claude.ai/share" u trenutku pisanja ovog teksta, navodi u svojoj tehničkoj dokumentaciji da programeri mogu da blokiraju veb krawlere pretraživača koristeći robots.txt — ali i da bi veb programeri trebalo da uključe i "noindex" oznaku na pojedinačnim stranicama.

Neka od ćaskanja koja su se pojavila u rezultatima pretrage spomenutim u objavi na Reditu bila su obrisana do trenutka kada ih je Vajerd (WIRED) pregledao, a rezultati se više ne pojavljuju na Guglu kada pretražujete "share" upit koji je i dalje radio na Bingu. U vodiču za programere, Gugl navodi da zanemaruje instrukcije iz robots.txt datoteke ako je ta stranica povezana sa nekog drugog mesta na internetu i ako vlasnik stranice takođe ne uključi posebnu "noindex" html oznaku na stranici ili "x-robots-tag" u zaglavlju odgovora stranice.

Foto: Tada Images / Shutterstock.com

Vajerd je pregledao uzorak izloženih Klodovih stranica za ćaskanje i utvrdio da one nisu sadržale oznaku "noindex" za koju i Bing i Gugl kažu da je uzimaju u obzir kada odlučuju da li će indeksirati stranicu ili ne.

"Dajemo ljudima kontrolu nad javnim deljenjem njihovih Klod razgovora i, u skladu sa našim principima privatnosti, ne delimo direktorijume ćaskanja niti mape sajta sa pretraživačima kao što je Gugl", kaže portparol Antropika.

"Ovi linkovi za deljenje se ne mogu pogoditi niti otkriti osim ako ljudi sami ne odluče da ih podele. Kada neko podeli razgovor, on čini taj sadržaj javno dostupnim i, kao i drugi javni veb sadržaj, mogu ga arhivirati usluge trećih strana."

Majkrosoft (Microsoft), koji je vlasnik Binga, nije dao komentar pre objavljivanja.

Portparol Gugla Ned Adrijans kaže za Vajerd da je indeksiranje deljenih Klodovih ćaskanja odgovornost Antropika.

"Niti Gugl niti bilo koji drugi pretraživač ne kontroliše koje stranice se čine javnim na vebu, a ove stranice su indeksirane na mnogim pretraživačima", kaže Adrijans. "Vlasnicima sajtova dajemo jasne kontrole da odluče da li stranice mogu da se krawluju ili indeksiraju, i uvek poštujemo te direktive."

Antropik nije odgovorio na pitanja o tome zašto nije uključio oznaku "noindex" na stranicama sa deljenim ćaskanjima.Prošlog septembra, Antropik se našao na udaru kritika zbog istog problema i rekao je za Forbs da koristi robots.txt kako bi krawlerima stavio do znanja da ne bi trebalo da pristupaju deljenim ćaskanjima. Ali kako se u izveštaju Forbsa ističe, nema garancije da će to sprečiti pretraživače da indeksiraju određene veb stranice.

Čak i ako robots.txt ne funkcioniše uvek kako bi sprečio indeksiranje stranica na pretraživačima, AI laboratorije ga i dalje koriste u druge svrhe. Mnoge laboratorije obećavaju kreatorima da se njihovi veb sajtovi neće koristiti kao materijal za obuku veštačke inteligencije sve dok programeri vode računa da "zabrane" određene krawlere u svojim robots.txt datotekama, a i same laboratorije prihvataju taj savet za sebe.

Antropik, Meta i OpenAI uključuju instrukcije u robots.txt datotekama svojih četbota koje "zabranjuju" veb krawlerima svojih konkurenata da pristupe bilo kom delu veb sajta na kojem su četboti smešteni. OpenAI i Meta nisu odgovorili na zahtev za komentar o ovoj praksi. Gugl se nije bavio pitanjima Vajerda o činjenici da njegovi konkurenti blokiraju njegov krawler za AI obuku, Gugl-Ekstended (Google-Extended), sa sajtova svojih četbota.

Iako se deljena ćaskanja više ne pojavljuju u Gugl rezultatima, stranice koje je Vajerd pregledao i dalje nemaju oznaku "noindex", što znači da bi potencijalno mogle ponovo da se pojave na pretraživačima. Korisnici Kloda mogu da odu na Podešavanja > Privatnost > Deljena ćaskanja kako bi upravljali pristupom — i sačuvali svoje tajne razgovore privatnim.

(Ubrzanje.rs/Wired)