Nvidia-ს ახალი კვლევა: რატომ არის „აღჭურვილობა“ და არა მოდელი ხელოვნური ინტელექტის ნამდვილი გმირი
Nvidia-ს ახალი კვლევა აჩვენებს, რომ რთული ამოცანების შესრულებისას ხელოვნური ინტელექტის მოდელზე მნიშვნელოვანი მისი „აღჭურვილობაა“, რამაც Claude Opus 5-ს 100%-იანი შედეგი მოუტანა.

Nvidia-მ გამოაქვეყნა ახალი კვლევა, რომელიც მიუთითებს, რომ რთული, მრავალეტაპიანი ამოცანების შესრულებისას ხელოვნური ინტელექტის მოდელზე ბევრად მნიშვნელოვანი მისი ე.წ. „აღჭურვილობა“ (harness) აღმოჩნდა. კვლევის მთავარი დასკვნა ასეთია: მეხსიერების მართვაზე მორგებული სპეციალური სისტემისა და „ზედამხედველი“ (supervisor) კომპონენტის გამოყენებით, მკვლევრებმა შეძლეს Claude Opus 5-ისთვის ინტერაქციულ ტესტში (ARC-AGI-3) 100%-იანი შედეგის მიღწევა.
აღსანიშნავია, რომ აღნიშნული ბენჩმარკი განსაკუთრებულ სირთულეს წარმოადგენს OpenAI-სთვისაც კი. სპეციალური აღჭურვილობის გარეშე Opus 5-მა მხოლოდ 30% დააგროვა, რაც თავისთავად საუკეთესო შედეგი იყო ტესტირებულ მოდელებს შორის. Nvidia-ს კვლევა კიდევ ერთი დასტურია იმისა, რომ მიუხედავად მოდელის მნიშვნელობისა, ის აგენტური სისტემის მხოლოდ მცირე ნაწილია, განსაკუთრებით მაშინ, როდესაც საქმე ხანგრძლივ პროცესებს ეხება.
სწორედ „აღჭურვილობა“ (harness) აქცევს მოდელს აგენტად: ის მართავს მეხსიერებას, კონტექსტსა და უკუკავშირს. Nvidia-ს ხელოვნური ინტელექტის განყოფილების პროდუქტების ვიცე-პრეზიდენტი, ადელ ელ ჰალაკი განმარტავს, რომ სამყარო აგენტს ხშირად აღიქვამს უბრალოდ მოდელის API-დ, თუმცა რეალობა ბევრად კომპლექსურია.
„ეს არის თავად მოდელი, მის გარშემო არსებული სკაფოლდინგი (scaffolding), რომელსაც ჩვენ აღჭურვილობას ვუწოდებთ, ანუ ინსტრუმენტების ნაკრები, რომელსაც ის იყენებს. ეს არის გარემო (runtime) და მასთან დაკავშირებული უნარები და ბიბლიოთეკები, რომლებზეც მას წვდომა აქვს“, — აცხადებს ელ ჰალაკი.
მრავალეტაპიანი ამოცანების სირთულე
მრავალეტაპიანი ამოცანები (Long-horizon tasks) გულისხმობს გადაწყვეტილებების ჯაჭვს, რომელიც ზოგჯერ დღეების განმავლობაში გრძელდება სამუშაოს დასასრულებლად. ეს რადიკალურად განსხვავდება ხელოვნური ინტელექტის მიერ მარტივ კითხვაზე პასუხის გაცემისგან. ასეთი ამოცანების შესრულებისას AI-ს ფოკუსის შენარჩუნება და „გზის აბნევის“ თავიდან აცილება აგენტური კვლევების ერთ-ერთი მთავარი გამოწვევაა.
მაგალითად, Microsoft-ის მიერ აპრილში გამოქვეყნებულმა კვლევამ, რომელმაც 19 სხვადასხვა ენობრივი მოდელი (LLM) გამოსცადა დოკუმენტების რედაქტირებაზე, აჩვენა, რომ ყველა მათგანი, მათ შორის მოწინავე მოდელებიც, დოკუმენტებს შეცდომებით ავსებდნენ. ზოგიერთ შემთხვევაში, დამოუკიდებლად მოქმედი მოდელები მომხმარებლის ფაილებსა და მონაცემთა ბაზებსაც კი შლიდნენ, ან მიზნის მისაღწევად კრიმინალურ ქმედებებსაც კი მიმართავდნენ, როგორიცაა ჰაკერობა.
ARC-AGI-3 ბენჩმარკი და OpenAI-ს რეაქცია
Nvidia-ს მკვლევრების მიერ ARC-AGI-3 ტესტის არჩევა განსაკუთრებით საინტერესოა. ეს ბენჩმარკი შედგება 2D თამაშებისგან, სადაც ინსტრუქციები არ არსებობს და მოდელმა თავად უნდა გაერკვეს, როგორ ითამაშოს და გაიმარჯვოს. 100%-იანი მაჩვენებელი ნიშნავს, რომ მოდელი ადამიანის დონეზე უმკლავდება ამ ამოცანებს.
OpenAI იმდენად შეშფოთდა საკუთარი მოდელების დაბალი შედეგებით (10%-ზე ნაკლები), რომ გასულ თვეში საკუთარი კვლევა ჩაატარა. Nvidia-ს მსგავსად, მათაც აღმოაჩინეს, რომ აღჭურვილობის მხოლოდ ორი პარამეტრის შეცვლით შედეგები გასამმაგდა, თუმცა 100%-იან ნიშნულს ვერცერთი მოდელი მიუახლოვდა.
„ზედამხედველი“ აგენტის როლი
Nvidia-ს მკვლევრებმა აჩვენეს, რომ სისტემას სჭირდება „ზედამხედველი“ კომპონენტი, რომელიც აგენტს სწორი მიმართულებით უბიძგებს, როდესაც ის ჩიხში შედის.
- ზედამხედველი აგენტი: მოქმედებს როგორც აღმასრულებელი დირექტორი (CEO).
- ფუნქცია: აძლევს მითითებებს მთავარ აგენტს, როდესაც ის არასწორ გზას ადგება ან მკვდარ წერტილში ხვდება.
- შედეგი: თავიდან აცილებულია ერთი და იმავე შეცდომის გამეორება.
მიუხედავად იმისა, რომ ზედამხედველი აგენტის კონცეფცია ახალი არ არის, მომხმარებელთა უმეტესობა დღეს მხოლოდ ერთშრიან აღჭურვილობას იყენებს (მაგ. Claude Code, Codex, Hermes). Nvidia-მ შექმნა საკუთარი გაუმჯობესებული სისტემა, სახელწოდებით Agentic Variation Operators (AVO).
ხარჯების ეფექტურობა და ღია სისტემები
Nvidia-ს შედეგები ამყარებს მოსაზრებას, რომ მოდელის არჩევანი არ არის ერთადერთი ფაქტორი. ივლისში Databricks-მა გამოაქვეყნა კვლევა, რომელიც აჩვენებს, რომ აღჭურვილობა დრამატულად მოქმედებს AI-ს ხარჯებზე.
„შეგიძლიათ აირჩიოთ ერთი და იგივე მოდელი, მაგრამ სხვადასხვა აღჭურვილობა და არასწორი სისტემის შემთხვევაში ხარჯები მნიშვნელოვნად გაგეზარდოთ. ამან შესაძლოა თქვენი ხარჯები გააორმაგოს (2x)“, — განაცხადა Databricks-ის აღმასრულებელმა დირექტორმა, ალი ღოდსიმ.
Nvidia-ს მთავარი გზავნილია, რომ ღია სისტემები მომხმარებელს ბევრად მეტ კონტროლს აძლევს. ელ ჰალაკის თქმით, ღია აგენტური სტეკი (open agent stack), სადაც კონტროლი ვრცელდება როგორც აღჭურვილობაზე, ისე ინფრასტრუქტურასა და გარემოზე, აუცილებელია ეკოსისტემის უსაფრთხო და ეფექტური განვითარებისთვის.
მსგავსი სტატიები

აშშ-ის იუსტიციის დეპარტამენტი a16z-ს იძიებს: რას ნიშნავს ეს ვენჩურული კაპიტალის ბაზრისთვის?
აშშ-ის იუსტიციის დეპარტამენტი Andreessen Horowitz-ის წინააღმდეგ ანტიმონოპოლიურ გამოძიებას აწარმოებს. გაიგეთ, როგორ ცვლის ეს ვენჩურული კაპიტალის მიდგომებს პორტფელური კომპანიების მართვაში.

Starcloud-მა ორბიტალური მონაცემთა ცენტრებისთვის 250 მილიონი დოლარი მოიზიდა: კოსმოსური გამოთვლების მომავალი და რაკეტების დეფიციტი
სტარტაპმა Starcloud-მა ორბიტალური მონაცემთა ცენტრების განვითარებისთვის 250 მილიონი დოლარი მოიზიდა. კომპანია SpaceX-ის Starship-თან თანამშრომლობას და კოსმოსში AI გამოთვლების გაძლიერებას გეგმავს.

ChatGPT-ს უკვე შეუძლია Apple-ის შეტყობინებების გაგზავნა: ახალი ფლაგინი OpenAI-სგან
OpenAI-მ Apple Messages-ის ფლაგინი წარადგინა, რომელიც ChatGPT-ს შეტყობინებების მართვის, ანალიზისა და მომხმარებლის სახელით გაგზავნის საშუალებას აძლევს.