Microsoft-ის ხელმძღვანელმა AI სკრეიპინგს „კაცობრიობის ისტორიაში შრომის უდიდესი ქურდობა“ უწოდა: ახალი დეტალები სასამართლო დავიდან
ახალი სასამართლო დოკუმენტების მიხედვით, Microsoft-ისა და OpenAI-ის ხელმძღვანელები AI ტრენინგს „ქურდობად“ და მედიისთვის „ეგზისტენციალურ საფრთხედ“ მიიჩნევდნენ.

სასამართლო დავაში, რომელიც The New York Times-მა OpenAI-ისა და Microsoft-ის წინააღმდეგ სამი წლის წინ წამოიწყო, ახალი გასაჯაროებული დოკუმენტები გამოჩნდა. ეს მასალები ადასტურებს, რომ კომპანიების შიგნით ხელოვნური ინტელექტის მიერ მონაცემების მოპოვება (ე.წ. სკრეიპინგი) ქურდობის ტოლფასად აღიქმებოდა, ხოლო AI პროდუქტები მედიაგამოცემებისთვის დიდ საფრთხედ მიიჩნეოდა.
სარჩელის მიხედვით, Microsoft-ის ერთ-ერთმა მაღალჩინოსანმა კომპანიების მიერ AI-ის წვრთნის პრაქტიკას პირად საუბრებში „ქურდობა“ უწოდა. თავად OpenAI-ის ხელმძღვანელობა კი აღიარებდა, რომ მათი მოდელები „ეგზისტენციალურ საფრთხეს“ უქმნიდა იმ გამომცემლებსა და ჟურნალისტებს, რომელთა ნამუშევრებზეც ეს მოდელები იწვრთნებოდა.
გასაჯაროებული მასალები დეტალურად აღწერს, თუ როგორ მოიპოვებდნენ და იყენებდნენ კომპანიები კონტენტს: ისინი შეუმჩნევლად გვერდს უვლიდნენ ფასიან ბარიერებს (paywalls), ქმნიდნენ საწვრთნელ ბაზებს მასობრივი სკრეიპინგის საშუალებით და მიზანმიმართულად შლიდნენ საავტორო უფლებების შესახებ ინფორმაციას მონაცემებიდან. აღსანიშნავია, რომ ინფორმაციის დიდი ნაწილი The Times-ის მიერ მომზადებული დოკუმენტებიდან ხდება ცნობილი, ხოლო უშუალო მტკიცებულებები კვლავ დალუქულია.
სამართლიანი გამოყენების არგუმენტი და ბაზრის დაზიანება
სასამართლო დავის მთავარი საკითხია, აქვთ თუ არა AI კომპანიებს საავტორო უფლებებით დაცული მასალების გამოყენების უფლება მოდელების გასაწვრთნელად. აქამდე მოსამართლეები მეტწილად იზიარებდნენ კომპანიების არგუმენტს „სამართლიანი გამოყენების“ (fair use) შესახებ. ეს წესი უშვებს საავტორო უფლებებით დაცული მასალის უნებართვო გამოყენებას ისეთ შემთხვევებში, როგორიცაა პაროდია, ახალი ამბების გაშუქება ან კრიტიკა.
მიმდინარე თვის დასაწყისში ტრამპის ადმინისტრაციამ წარადგინა დოკუმენტი OpenAI-ის დასაცავად, სადაც მხარი დაუჭირა ლიცენზიის გარეშე მასალების გამოყენებას LLM-ების (დიდი ენობრივი მოდელების) გასაწვრთნელად. თუმცა, ახალი აღიარებები ეწინააღმდეგება „სამართლიანი გამოყენების“ პრინციპს, რომელიც მოითხოვს, რომ გამოყენებამ არ ჩაანაცვლოს ორიგინალი ნამუშევარი და არ დააზიანოს მისი ბაზარი.
„დაღუპვის ციკლი“ და ეკონომიკური გავლენა
Microsoft-ის შიდა მონაცემები აჩვენებს, რომ მათმა „პასუხების საძიებო სისტემამ“ Copilot-მა The New York Times-ის დომენზე გადასვლების მაჩვენებელი (click-through rates) 93%-ით შეამცირა ტრადიციულ Bing-ის ძიებასთან შედარებით. Microsoft-ის გამოყენებითი მეცნიერებების დირექტორმა, ბრენტ ჰეხტმა, 2024 წლის იანვრის პრეზენტაციაში ამ კლებას „დაღუპვის ციკლი“ (doom loop) უწოდა, რაც მისი თქმით, „ერთდროულად დააზიანებდა მოდელების ეფექტურობასაც და მთლიან ინტერნეტსაც“.
„უკიდურესად იშვიათია შემთხვევა, როდესაც საბოლოო პროდუქტი საფრთხეს უქმნის მისი ძირითადი მომწოდებლების ეკონომიკურ საფუძვლებს, მაგრამ სწორედ ასეთი სიტუაცია შევქმენით ჩვენი LLM ბიზნესისთვის კონტენტის მიწოდების ჯაჭვთან მიმართებით“, — ნათქვამია Microsoft-ის დოკუმენტში.
ხელმძღვანელების ჩვენებები და შიდა მიმოწერები
Microsoft-ის აღმასრულებელმა დირექტორმა, სატია ნადელამ, ჩვენების მიცემისას განაცხადა, რომ ნებისმიერი ფასიანი კონტენტი ლიცენზირებული უნდა იყოს მათ მიერ, ვისაც მისი გამოყენება AI-ის წვრთნისთვის სურს. მან ასევე აღნიშნა, რომ თუ ეცოდინებოდა, რომ OpenAI ფასიან მასალებს სკრეიპინგით მოიპოვებდა, ის გამოიყენებდა Microsoft-ის უფლებას და მოსთხოვდა OpenAI-ს მოდელების ხელახლა გაწვრთნას.
სხვა აღიარებები კიდევ უფრო ამძაფრებს ვითარებას:
- OpenAI-ის ChatGPT-ის ხელმძღვანელმა, ნიკ ტერლიმ, შიდა მიმოწერაში აღნიშნა, რომ გამომცემლები „ეგზისტენციალური საფრთხის“ წინაშე დგანან, რადგან ჩატბოტები მათ სრულად ანაცვლებენ.
- OpenAI-ის პრეზიდენტმა, გრეგ ბროკმანმა, მოდელებს უწოდა „შესანიშნავი ახალი ამბების გაშუქებაში“.
- სატია ნადელამ დაადასტურა, რომ ჩატბოტებთან კომუნიკაციამ ჩაანაცვლა ვებგვერდებზე ინფორმაციის მოძიების საჭიროება.
კოპირების მასშტაბები და საიდუმლო პროექტები
დოკუმენტები პირველად ააშკარავებს კოპირების მასშტაბებს. OpenAI-ის შუალედური წვრთნის ბაზები შეიცავს NYT-ის, Daily News-ისა და საგამოძიებო რეპორტინგის ცენტრის (CIR) ნამუშევრების 91,692-ზე მეტ ასლს. Common Crawl-იდან მიღებული მონაცემთა ბაზა კი მხოლოდ nytimes.com-იდან 2 მილიონზე მეტ დოკუმენტს მოიცავდა.
ბრენტ ჰეხტმა 2023 წლის იანვრის მემორანდუმში ამას უწოდა „უპრეცედენტო მასშტაბის განსაცვიფრებელი ქურდობა“ და „კაცობრიობის ისტორიაში შრომის უდიდესი ქურდობა“.
გასაჯაროებული მასალები ასევე აღწერს კონტენტის მოპოვების გზებს:
- OpenAI-მ GPT-3-ის სრული საწვრთნელი ბაზა გადასცა Microsoft-ს კომერციული მიზნებისთვის.
- Microsoft-მა OpenAI-ს მიაწოდა მონაცემები ინიციატივების ფარგლებში, რომლებსაც „Project Taxi“ და „Project Mango“ ეწოდებოდა.
- „Project Mango“-ს ბაზა შეიცავდა მედიაგამოცემების სულ მცირე 160,903 უნიკალური ნამუშევრის ასლს.
ფასიანი ბარიერების გვერდის ავლის მეთოდები
დოკუმენტების მიხედვით, OpenAI-ის თანამშრომლებმა შეიმუშავეს გეგმა, თუ როგორ აერიდებინათ თავი ფასიანი ბარიერებისთვის (paywalls) შეუმჩნევლად. როდესაც მკვლევარმა ნიკ რაიდერმა გრეგ ბროკმანს აცნობა NYT-ის ფასიანი ბარიერის გვერდის ავლის „ჰაკერული გზის“ შესახებ, ბროკმანმა უპასუხა: „აჰ, კარგია“.
გარდა ამისა, კომპანიებმა შექმნეს საწვრთნელი ბაზები WebText და WebText2, რომლებიც არაპროპორციულად ეყრდნობოდა სკრეიპინგით მოპოვებულ საინფორმაციო კონტენტს. მკვლევარები ასევე მიზანმიმართულად შლიდნენ საავტორო უფლებების ნიშნებს, რათა მოდელს მომხმარებლისთვის პასუხის გაცემისას ეს ნიშნები არ გამოეტანა.
OpenAI-სა და Microsoft-ს აღნიშნულ საკითხზე კომენტარი ჯერჯერობით არ გაუკეთებიათ.
მსგავსი სტატიები

მსოფლიო მოდელების შემქმნელი AI კომპანიები გასაიდუმლოებულ რეჟიმში მუშაობენ
ხელოვნური ინტელექტის წამყვანი კომპანიები, როგორიცაა AMI Labs და World Labs, სამყაროს მოდელებზე მუშაობენ, თუმცა მათ კომერციულ გეგმებსა და პროდუქტებს საიდუმლოდ ინახავენ.

ScrollEd-ს სურს სახელმძღვანელოები TikTok-ის ფორმატის პლატფორმად გარდაქმნას
სტარტაპი ScrollEd სახელმძღვანელოებს TikTok-ის მსგავს ვერტიკალურ არხად აქცევს, სადაც სწავლება AI ვიდეოებითა და ინტერაქციული ქვიზებით ხდება.

Vocci-ს ბეჭედი: შეხვედრების ჩასაწერად შექმნილი ახალი ფორმ-ფაქტორი ხელოვნური ინტელექტის მხარდაჭერით
Vocci-მ წარადგინა ხელოვნური ინტელექტის მხარდაჭერის მქონე ჭკვიანი ბეჭედი, რომელიც შეხვედრების ჩასაწერად და ტრანსკრიფციისთვისაა შექმნილი. მოწყობილობა გამოირჩევა კომპაქტურობითა და სიმსუბუქით.