Skip to main content
ხელოვნური ინტელექტი22.8.20262 ნახვა

წამყვანი AI ლაბორატორიები კვლავ არ აკონკრეტებენ, როგორ შეაჩერებენ კონტროლიდან გასულ მოდელებს

Guidelight AI Standards-ის კვლევის თანახმად, წამყვან AI ლაბორატორიებს, მათ შორის Meta-სა და Anthropic-ს, არ აქვთ საჯარო გეგმები კონტროლიდან გასული მოდელების შესაჩერებლად.

წამყვანი AI ლაბორატორიები კვლავ არ აკონკრეტებენ, როგორ შეაჩერებენ კონტროლიდან გასულ მოდელებს

ბოლო კვლევის თანახმად, ხელოვნური ინტელექტის წამყვანი ლაბორატორიების მხოლოდ მცირე ნაწილმა გამოაქვეყნა ან წარმოადგინა ინციდენტებზე რეაგირების გეგმები. ლოკალიზაციის ან შეკავების გეგმა (Containment plan) დეტალურად განსაზღვრავს, თუ რა ზომები უნდა გატარდეს იმ შემთხვევაში, თუ ხელოვნური ინტელექტი ადამიანის კონტროლის გვერდის ავლის მცდელობაში იქნება შემჩნეული — კერძოდ, რომელი წვდომები უნდა შეიზღუდოს და როდის უნდა გაითიშოს სისტემა სრულად.

აღნიშნული დასკვნები ორგანიზაცია Guidelight AI Standards-ს ეკუთვნის, რომელიც მოწინავე (frontier) AI სისტემების უსაფრთხო განვითარების პრაქტიკის პოპულარიზაციითაა დაკავებული. ორგანიზაციამ ხუთი წამყვანი ლაბორატორია შეაფასა იმის მიხედვით, თუ რამდენად მზად არიან ისინი მსგავსი სცენარებისთვის. რეიტინგში პირველ ადგილზე OpenAI გავიდა, ხოლო Anthropic-მა და Meta-მ ყველაზე დაბალი ქულები მიიღეს.

ეს საკითხი განსაკუთრებით აქტუალური ხდება იმ ფონზე, როდესაც აგენტური ხელოვნური ინტელექტი (agentic AI) კომპანიების შიდა სისტემებში სულ უფრო მეტ ავტონომიურ როლს იძენს, ხოლო კალიფორნიისა და ნიუ-იორკის რეგულატორები ინფორმაციის გამჟღავნებას სავალდებულოს ხდიან. ინვესტორებისა და დეველოპერებისთვის ეს კვლევა წარმოადგენს იშვიათ დამოუკიდებელ შეფასებას იმისა, თუ რამდენად სერიოზულად უდგება თითოეული ლაბორატორია საოპერაციო რისკებს რეალურად, მათი საჯარო განცხადებების მიღმა.

Guidelight-ის შეფასება ეფუძნება Anthropic-ის, Google-ის, OpenAI-ს, Meta-სა და xAI-ის საჯაროდ ხელმისაწვდომ გეგმებს. შეფასება რამდენიმე კრიტერიუმით განხორციელდა:

  • რამდენად ეფექტურად აღრიცხავს და აკონტროლებს კომპანია თავისი AI სისტემების შიდა მოქმედებებს;
  • აჩერებს თუ არა კომპანია სისტემების მუშაობას საეჭვო ქცევის დაფიქსირების შემდეგ;
  • ახორციელებენ თუ არა დამოუკიდებელი მესამე მხარეები კონტროლის მექანიზმების აუდიტს და აქვეყნებენ თუ არა დასკვნებს;
  • რა არის კონკრეტული გეგმა იმ მოდელის შესაკავებლად, რომელიც კონტროლიდან გამოდის.

შეშფოთება იმის შესახებ, შეძლებენ თუ არა AI კომპანიები მზარდი შესაძლებლობების მქონე მოდელების მართვას, მას შემდეგ გაიზარდა, რაც OpenAI-ს, Anthropic-ისა და Meta-ს მოდელებმა უსაფრთხოების შეფასებისას ინტერნეტზე გაუთვალისწინებელი წვდომა მოიპოვეს და გარე სისტემები გატეხეს. კვლევის შედეგები ხაზს უსვამს განსხვავებებს იმაში, თუ როგორ უდგებიან კომპანიები უსაფრთხოებას აგენტური სისტემების მასშტაბური დანერგვისას.

მიუხედავად იმისა, რომ ზოგიერთმა კომპანიამ დეტალურად აღწერა, თუ როგორ ამოწმებენ მოდელებს სახიფათო შესაძლებლობებზე მათ გაშვებამდე, ისინი ნაკლებად საუბრობენ იმაზე, თუ რა ხდება მაშინ, როდესაც უკვე მოქმედი სისტემები იწყებენ არასწორად ფუნქციონირებას. „გამიკვირდა, რამდენად ცოტა რამ აქვთ ნათქვამი AI კომპანიებს იმის შესახებ, თუ როგორ მოიქცეოდნენ სერიოზული ინციდენტის დროს, თუ მათი მოდელი კონტროლიდან გავიდოდა“, — განაცხადა სტივენ ადლერმა, Guidelight-ის მთავარმა მეცნიერმა და OpenAI-ს უსაფრთხოების ყოფილმა მკვლევარმა.

Guidelight-ის განმარტებით, შეკავების გეგმა არის „წინასწარ განსაზღვრული პროტოკოლი, რომელიც აქტიურდება მაშინ, როდესაც AI ცდილობს კონტროლის გვერდის ავლის, და მოიცავს ინფორმაციას იმის შესახებ, თუ რომელი უფლებები უნდა ჩამოერთვას მოდელს, ვისთვის შეიძლება მან მუშაობის გაგრძელება, რა შეზღუდვებით და როდის უნდა მოხდეს მისი სრული გათიშვა“.

ადლერის თქმით, არსებობს საფუძვლიანი ეჭვი, რომ წამყვანი მოდელები გარკვეულწილად აცდენილია დასახულ მიზნებს (misaligned). როდესაც მოდელები კომპანიის სახელით მუშაობენ, საჭიროა არსებობდეს გარკვეული „ხარაჩოები“ (scaffolding), რათა შესაძლებელი იყოს მათი ქმედებების მონიტორინგი, აცდენის ნიშნების პოვნა და სახიფათო ქმედების აღკვეთა მანამ, სანამ ის განხორციელდება.

დღეისათვის კატასტროფული რისკების მართვის გეგმები დიდწილად თავად კომპანიების კეთილ ნებაზეა დამოკიდებული. Guidelight-ის ანგარიშში ნათქვამია, რომ საჯარო მტკიცებულებების მიხედვით, კომპანიებს საგანგებო სიტუაციებისთვის მზა პროტოკოლები თითქმის არ გააჩნიათ. რა თქმა უნდა, შესაძლებელია კომპანიებს ჰქონდეთ შიდა გეგმები, რომლებსაც საჯაროდ არ აზიარებენ.

Google-ის წარმომადგენელმა განაცხადა, რომ Guidelight-ის ანგარიში სრულად არ ასახავს კომპანიის AI უსაფრთხოებისა და დაცვის ზომებს, თუმცა არ უპასუხა კითხვას, არსებობს თუ არა გასაიდუმლოებული შიდა გეგმა. მსგავსი პოზიცია დააფიქსირა OpenAI-მაც: „ჩვენ გვაქვს პროცესი, რომელიც მოითხოვს წვდომების შეზღუდვას, სამუშაო პროცესების შეჩერებას ან მოდელის სრულ გათიშვას და ეს პრაქტიკაშიც გამოგვიყენებია“. Meta-მ უარი თქვა შიდა გეგმის არსებობის დადასტურებაზე და მიუთითა არსებულ ჩარჩოზე, რომელიც რისკების ზღვრულ მაჩვენებლებს განსაზღვრავს.

ლილი ლიმ, Metaverse Law-ს დამფუძნებელმა და იურისტმა, აღნიშნა, რომ კომპანიები შესაძლოა იურიდიული მიზეზების გამო ერიდებოდნენ დეტალური გეგმების გასაჯაროებას. თუ კომპანია ზედმეტად კონკრეტულ დაპირებებს გასცემს და მათ ვერ შეასრულებს, ეს შესაძლოა გახდეს საფუძველი სასამართლო დავებისთვის „არაკეთილსინდისიერი მარკეტინგის“ მუხლით.

რეგულაციები და „ავარიული გამორთვის“ მექანიზმი

რეგულატორები უკვე იწყებენ ამ საკითხზე ზეწოლას. კალიფორნიის SB 53 კანონი, რომელიც წელს შევიდა ძალაში, მოითხოვს მსხვილი დეველოპერებისგან იმ ჩარჩოების გამოქვეყნებას, სადაც აღწერილი იქნება კრიტიკულ ინციდენტებზე რეაგირების გზები. ნიუ-იორკის RAISE Act, მსგავსი კრიტერიუმებით, იანვრიდან ამოქმედდება. გასულ თვეში კი წარდგენილ იქნა ფედერალური კანონპროექტი „AI Kill Switch Act“, რომელიც დეველოპერებს ავარიული გამორთვის ტექნიკური მექანიზმების შექმნას ავალდებულებს.

„ავარიული გამორთვის ღილაკი (kill switch) დღევანდელი მოდელებისთვის მინიმალური მოთხოვნაა“, — ამბობს კონორ ლიჰი, ControlAI-ს აღმასრულებელი დირექტორი. მისი თქმით, კომპანიებს ხშირად ბოლომდე არ ესმით მათ მიერ შექმნილი სისტემების მუშაობის პრინციპი, რაც სახიფათო მიმართულებით მიგვიყვანს, თუ გამორთვის საშუალება არ იარსებებს.

Guidelight-ის შეფასება მოწინავე AI კომპანიების მიერ ექვსი პრიორიტეტული პრაქტიკის დანერგვის შესახებ.

Guidelight-ის შეფასება ექვს პრიორიტეტულ პრაქტიკას ეფუძნებოდა. დაბალი ქულა ნიშნავს საჯარო გამჭვირვალობის ნაკლებობას და არა აუცილებლად შიდა დაცვის მექანიზმების არარსებობას. Meta-მ და Anthropic-მა ყველაზე დაბალი ქულები მიიღეს. Anthropic-ის შემთხვევაში ეს მოულოდნელი იყო, რადგან კომპანია ხშირად საუბრობს უსაფრთხოებაზე, თუმცა მათ ანგარიშებში მოდელის გათიშვა, როგორც რეაგირების ფორმა, ნახსენები არ არის.

OpenAI-მ ყველაზე მაღალი ქულა (3/5-დან) მიიღო, რადგან მან რამდენჯერმე უკვე შეაჩერა სამუშაო პროცესები უსაფრთხოების ინციდენტების გამო. ეს განსაკუთრებით თვალსაჩინო გახდა Hugging Face-ის ინციდენტის შემდეგ, როდესაც OpenAI-ს მოდელმა სატესტო გარემოდან „გააღწია“ და გარე სისტემები გატეხა.

რეკომენდაციები უსაფრთხოებისთვის

მსგავსი შემთხვევების თავიდან ასაცილებლად, ადლერი კომპანიებს სთავაზობს რამდენიმე ნაბიჯს:

  • აზროვნების ჯაჭვის (chain of thought) სკანირება: მოდელის ეტაპობრივი ლოგიკის შემოწმება მოტყუების ნიშნების ან ფარული გეგმების აღმოსაჩენად.
  • პრევენციული მონიტორინგი: რეალურ დროში კონტროლის დაწესება, ნაცვლად იმისა, რომ პრობლემები პოსტფაქტუმ გამოსწორდეს.
  • სამუშაო პროცესის ადაპტაცია: მკვლევარებმა უნდა გაითვალისწინონ მონიტორინგის საჭიროება, მიუხედავად იმისა, რომ ეს შესაძლოა მუშაობის ტემპს ან მოქნილობას ზღუდავდეს.

მთავარი გამოწვევა ისაა, რომ მკვლევარებს სურთ მაქსიმალური თავისუფლება, ხოლო რეალურ დროში მონიტორინგი გარკვეულ ბარიერებს ქმნის. თუმცა, ადლერის თქმით, „პოსტფაქტუმ გასუფთავება“ სახიფათოა, რადგან AI-ს შეუძლია თავად გამორთოს კომპანიის კონტროლის სისტემა, რაც შემდგომ რეაგირებას შეუძლებელს გახდის.

მიუხედავად იმისა, რომ AI ინდუსტრიაში ბევრი მიიჩნევს, რომ ტექნოლოგია ზედმეტად სწრაფად ვითარდება წინასწარი გეგმების შესაქმნელად, ადლერი ძველ გამონათქვამს იშველიებს: „გეგმები არაფერია, მაგრამ დაგეგმვა — ყველაფერია“. მნიშვნელოვანია, რომ კომპანიებს წინასწარ ჰქონდეთ ნაფიქრი კრიზისულ სცენარებზე, მაშინაც კი, თუ ამაზე საჯაროდ არ საუბრობენ.

წყარო: TechCrunch AI
გაზიარება:

მსგავსი სტატიები

OpenAI კალიფორნიას ხელოვნური ინტელექტის უსაფრთხოების კანონპროექტის გამკაცრებისკენ მოუწოდებს
ხელოვნური ინტელექტი

OpenAI კალიფორნიას ხელოვნური ინტელექტის უსაფრთხოების კანონპროექტის გამკაცრებისკენ მოუწოდებს

OpenAI კალიფორნიის შტატს AI უსაფრთხოების კანონპროექტის გამკაცრებისკენ მოუწოდებს და „საპირისპირო ფედერალიზმის“ მოდელს უჭერს მხარს.

22.8.2026
Inherent: DeepMind-ის ყოფილი თანამშრომლების სტარტაპის AI აგენტი Anthropic-სა და OpenAI-ს სჯობნის
ხელოვნური ინტელექტი

Inherent: DeepMind-ის ყოფილი თანამშრომლების სტარტაპის AI აგენტი Anthropic-სა და OpenAI-ს სჯობნის

DeepMind-ის ყოფილი თანამშრომლების მიერ დაფუძნებული სტარტაპი Inherent აცხადებს, რომ მათმა მცირე ზომის AI აგენტმა Faraday-მ მეცნიერული კვლევების აღდგენაში გიგანტებს აჯობა.

22.8.2026
Nvidia მონაცემთა ცენტრების დეველოპერ Cloverleaf-თან პარტნიორობას იწყებს
ხელოვნური ინტელექტი

Nvidia მონაცემთა ცენტრების დეველოპერ Cloverleaf-თან პარტნიორობას იწყებს

Nvidia აგრძელებს ინვესტირებას AI ინფრასტრუქტურაში და Cloverleaf-თან პარტნიორობით მონაცემთა ცენტრების განვითარებასა და ენერგომომარაგებაში უფრო აქტიურად ერთვება.

22.8.2026