AI firmy tajne vykupujú milióny starých kníh vydané pred rokom 2022
Kľúčové zistenia:
-
Tréningové texty z internetu obsahujú čoraz viac obsahu generovaného strojmi, čo zhoršuje výstupy učiacich sa modelov.
-
Tlačené knihy vydané pred rokom 2022 poskytujú fyzickú záruku absencie umelej inteligencie v textových materiáloch.
-
Prevod starých kníh do digitálnej podoby zahŕňa hromadné nákupy, prísne utajenie a masívne fyzické ničenie publikácií.
Vývojári pokročilých AI modelov začali vo veľkom a systematicky vykupovať fyzické knihy vydané pred rokom 2022. Príčinou tohto javu je neustále klesajúca kvalita tréningových dát, ktoré spoločnosti dokážu získať bežným prečesávaním obsahu na internete.
Súčasný webový priestor je už do veľkej miery preplnený nekvalitnými textami, ktoré vo veľkom vygenerovali iné algoritmické systémy. Ak sa modely trénujú na takýchto zrecyklovaných dátach, vzniká proces známy ako modelový kolaps s rastúcou chybovosťou výstupov. Firmy navyše čelia hrozbe takzvaného vnorenia manipulačného obsahu, kedy nahnevaní autori úmyselne sabotujú cudzie tréningové procesy vkladaním skrytého kódu.
Funkčným riešením tohto komplexného problému sú práve staršie publikácie, ktoré v minulosti prešli kurátorským výberom a odbornými redakčnými úpravami. Všetky fyzické knihy publikované pred príchodom moderných jazykových modelov sú už zo svojej podstaty štrukturálne imúnne voči digitálnej kontaminácii.
Tieto výtlačky tak v súčasnosti predstavujú najčistejší dostupný súbor hlbokých ľudských znalostí chránených pred softvérovými manipulačnými nástrojmi. Hromadné nákupy takejto literatúry vo svete zastrešuje primárne knižná databáza operujúca pod komerčným označením ISBNdb. Táto platforma dokáže sprostredkovať korporátny predaj objemov začínajúcich na hranici tisíc kusov a končiacich pri milióne zväzkov v jednej objednávke.
Celý obchodný proces a presun kníh funguje v režime prísneho utajenia, ktoré zabezpečujú viazané dohody o mlčanlivosti strán. Spravujúca databáza garantuje, že presná identita nakupujúcich technologických firiem a ich zberateľská stratégia nebudú verejne odhalené. Táto vysoká miera opatrnosti súvisí so zistením, že hromadné nakupovanie a deštrukcia množstva textov predstavuje závažný reputačný problém v spoločnosti.
Nedávne spory o porušovanie autorských práv však odhalili, že popredné technologické firmy vykupujú milióny kníh z dostupných predajných sietí napriek utajeniu. Zväzky podrobujú procesu takzvaného deštruktívneho skenovania, čím sa fyzická verzia kvôli úspore priestoru nahradí novou digitálnou kópiou.
PREČO JE TO DÔLEŽITÉ: Snaha získať čisté dáta a vedomosti pre nové modely priamo podporuje masovú fyzickú likvidáciu existujúcich kníh a ochudobňuje dostupné kultúrne dedičstvo.
Zdroj: 404media.co foto: ChatGPT