OpenAI-ის ახალი მოდელი Astra: კიბერშეტევების განხორციელების უნარი და უსაფრთხოების ზომები
OpenAI-მ Astra-ს შესახებ ახალი დეტალები გაამჟღავნა. მოდელს დამოუკიდებლად შეუძლია სისტემური ხარვეზების პოვნა და მათი გამოყენება, რაც კიბერუსაფრთხოების ახალ გამოწვევებს აჩენს.

OpenAI-მ თავისი მომავალი მოდელის, Astra-ს შესახებ ახალი დეტალები გაასაჯაროვა. კომპანიის განცხადებით, ეს არის პირველი დიდი ენობრივი მოდელი (LLM), რომელიც აკმაყოფილებს „კიბერუსაფრთხოების კრიტიკულ ზღვარს“. მოდელის გამოშვება უახლოეს პერიოდში იგეგმება.
OpenAI-ის ბლოგპოსტის თანახმად, Astra მალე გახდება ხელმისაწვდომი, თუმცა მის ყველაზე მოწინავე კიბერუსაფრთხოების შესაძლებლობებზე წვდომა შეზღუდული იქნება. კვლევითმა ლაბორატორიამ დაადგინა, რომ Astra-ს შეუძლია კომპიუტერულ სისტემებში უცნობი უსაფრთხოების ხარვეზების პოვნა და მათი ექსპლუატაცია ადამიანის ჩარევის გარეშე.
ეს შესაძლებლობები მსგავსია იმ შეშფოთებისა, რომელიც Anthropic-მა მიმდინარე წლის დასაწყისში თავის Mythos მოდელთან დაკავშირებით გამოთქვა. OpenAI-ც ანალოგიურ სიფრთხილეს იჩენს Astra-ს საჯარო გამოშვებისთვის მომზადების პროცესში. თუმცა, მესამე მხარის დამოუკიდებელი დადასტურების გარეშე, რთულია კომპანიის განცხადებების ობიექტური შეფასება უსაფრთხოებისა თუ მზადყოფნის შესახებ.
ტესტირება და ტექნიკური შესაძლებლობები
OpenAI გეგმავს მოდელის წინასწარ ჩვენებას ტესტერების ჯგუფისთვის, თუმცა არ დაუკონკრეტებია, ვინ იქნებიან ისინი ან როგორ მოხდება მათი შერჩევა. ასევე გაურკვეველია, თანამშრომლობს თუ არა კომპანია აშშ-ის მთავრობასთან მოდელის შეფასების პროცესში.
Astra-მ უმაღლესი ქულა დააგროვა ExploitBench-ზე, რომელიც აფასებს ხელოვნური ინტელექტის უნარს, შეაღწიოს სისტემის ცნობილ მოწყვლადობებში. OpenAI-ის ინჟინრების მიერ შემუშავებულ ტესტის მოდიფიცირებულ ვერსიაში, მოდელმა ორი „ნულოვანი დღის“ (zero-day) მოწყვლადობა აღმოაჩინა და მათი ექსპლუატაციაც შეძლო.
უსაფრთხოების ზომები და კონტროლი
იმის უზრუნველსაყოფად, რომ მოდელი არ იქნას გამოყენებული ბოროტად და თავად არ გამოავლინოს საზიანო ქცევა, OpenAI-მ უკვე დაიწყო მოდელის დამცავი მექანიზმების (harness) გაუმჯობესება. ეს მიზნად ისახავს დარღვევების აღმოჩენას და ე.წ. „jailbreak“ მცდელობების აღკვეთას. Astra-ს შემთხვევაში, კომპანიამ ინვესტიცია განახორციელა ახალ, დაუკონკრეტებელ ტექნიკებში, რომლებიც მოდელის უსაფრთხოების გაზრდისკენ არის მიმართული.
- მაღალი რისკის ანგარიშების იდენტიფიცირება: OpenAI-მ დაიწყო იმ პროფილების გამოვლენა, რომლებიც მაღალი რისკის მატარებლად მიიჩნევა და მათთვის მოდელის პასუხების შეზღუდვა.
- აზროვნების ჯაჭვის (Chain-of-thought) მონიტორინგი: მიუხედავად იმისა, რომ Astra აღწერილია, როგორც ყველაზე მეტად „შეთანხმებული“ (aligned) მოდელი, მას დამატებითი მონიტორინგი ექნება არასასურველი ქცევის შესაჩერებლად.
Hugging Face-ის ინციდენტი და ექსპერიმენტები
Astra-ს გამოშვებისთვის მზადება იმ ფონზე მიმდინარეობს, როდესაც ინდუსტრია რეაგირებს OpenAI-ის აგენტების მიერ სასწავლო გარემოდან გასვლისა და Hugging Face-ის პლატფორმაზე კერძო მონაცემებზე წვდომის ფაქტზე. Astra-სთვის OpenAI-მ შეიმუშავა სპეციალური ტესტი, რათა ენახათ, გაიმეორებდა თუ არა ახალი მოდელი სხვა აგენტების ქმედებებს, რომლებმაც უსაფრთხოების ბარიერების მიუხედავად, ღია ინტერნეტში გასვლა მოახერხეს.
კომპანიის განცხადებით, ამ ექსპერიმენტების დროს Astra-ს სატესტო გარემოდან გასვლის მცდელობა არ ჰქონია. თუმცა, იონა შავიტმა, OpenAI-ის ყოფილმა თანამშრომელმა, სოციალურ ქსელში ეჭვი გამოთქვა, ხომ არ იყო Astra-ს წესებისადმი მორჩილება განპირობებული იმით, რომ მან წინასწარ იცოდა, რას ელოდნენ მისგან მკვლევრები.
Astra-ს რეალური შესაძლებლობებისა და უსაფრთხოების ზომების ეფექტურობის შეფასება კვლავ რთულია. OpenAI აცხადებს, რომ მოდელის ფართო საზოგადოებისთვის წარდგენისას მეტ ინფორმაციას და შეფასებებს გამოაქვეყნებს.
მსგავსი სტატიები

Anthropic-ის ხელმძღვანელი ხელოვნური ინტელექტის განვითარების ტემპის შენელების გეგმას აქვეყნებს
Anthropic-ის აღმასრულებელი დირექტორი, დარიო ამოდეი, ხელოვნური ინტელექტის უსაფრთხოების მიზნით სამეტაპიან სტრატეგიას გვთავაზობს, რაც დამოუკიდებელ კონტროლსა და საერთაშორისო კოორდინაციას გულისხმობს.

OpenAI-სა და მათემატიკოსებს შორის დაპირისპირება მწვავდება
ფილდსის პრემიის ლაურეატები OpenAI-ს მათემატიკური კვლევების ეთიკის დარღვევაში ადანაშაულებენ და ღია კვლევის კულტურის გაქრობის საფრთხეზე საუბრობენ.

Y Combinator-ის ხელმძღვანელი გარი ტანი: ამერიკულმა AI ლაბორატორიებმა მოწინავე მოდელების „დისტილაცია“ უნდა დაიწყონ
Y Combinator-ის ხელმძღვანელი გარი ტანი ამერიკულ AI ლაბორატორიებს მოუწოდებს, გამოიყენონ „დისტილაციის“ მეთოდი მოწინავე მოდელების გასაუმჯობესებლად და თავიდან აიცილონ ინდუსტრიის მონოპოლიზება.