Skip to main content
ხელოვნური ინტელექტი13.8.202611 ნახვა

Anthropic-ის ექსპერიმენტი: ხელოვნური ინტელექტის აგენტებმა ერთმანეთს „ომი“ გამოუცხადეს

Anthropic-ის ახალი კვლევა აჩვენებს, თუ როგორ გადადის ხელოვნური ინტელექტის აგენტებს შორის ურთიერთქმედება აგრესიულ კონკურენციაში, საბოტაჟსა და ფასების ფარულ შეთანხმებებში.

Anthropic-ის ექსპერიმენტი: ხელოვნური ინტელექტის აგენტებმა ერთმანეთს „ომი“ გამოუცხადეს

რა ხდება მაშინ, როდესაც ხელოვნური ინტელექტის აგენტებს ერთმანეთის პირისპირ ვაყენებთ? Anthropic-ის მიერ ჩატარებული ტესტირების თანახმად, სიტუაცია ძალიან სწრაფად ხდება ქაოტური. ხუთშაბათს Anthropic-ის Frontier Red Team-მა გამოაქვეყნა ახალი კვლევა, რომელიც შეისწავლის AI აგენტების ჯგუფების ქცევას, როდესაც ისინი ერთმანეთს რეალურ პირობებში ხვდებიან. მიღებული შედეგები გვაძლევს წარმოდგენას იმ პოტენციურ რისკებზე, რომლებიც შეიძლება წარმოიშვას, როდესაც კომპანიები და მთავრობები დაიწყებენ აგენტების დანერგვას საერთო კოდების ბაზებში, ბაზრებსა და კომპიუტერულ სისტემებში.

ერთ-ერთ ექსპერიმენტში Anthropic-მა Claude-ის სამ აგენტს მისცა წვდომა ერთსა და იმავე პროგრამულ პროექტზე, თუმცა თითოეულს ჰქონდა ინდივიდუალური და ერთმანეთთან შეუთავსებელი ინსტრუქციები. აგენტებისთვის არ უთქვამთ, რომ იმავე პროექტზე სხვა აგენტებიც იმუშავებდნენ, რათა მკვლევარებს დაკვირვება შეძლებოდათ მათ ქმედებებზე ინტერაქციის დროს. Anthropic-ის მკვლევარების თქმით, მათ მუდმივად ხედავდნენ „მრავალაგენტიან ტერიტორიულ ომს“. მოდელებმა ჩათვალეს, რომ სხვები „განზრახ აფერხებდნენ მათ მუშაობას“ და დაიწყეს ერთმანეთის საბოტაჟი „სულ უფრო აგრესიული, თვითრეპლიცირებადი მავნე პროგრამების“ გამოყენებით.

ეს კვლევა მოჰყვა რამდენიმე გახმაურებულ შემთხვევას, როდესაც Anthropic-ისა და OpenAI-ის აგენტებმა კიბერუსაფრთხოების შეფასებისას დატოვეს იზოლირებული გარემო (sandbox) და რეალურ სისტემებში შეაღწიეს. მიუხედავად იმისა, რომ AI უსაფრთხოების წრეებში დისკუსიის დიდი ნაწილი ფოკუსირებულია იმაზე, თუ რა ხდება, როდესაც ერთი ავტონომიური აგენტი გამოდის კონტროლიდან, Anthropic-ის ბოლო კვლევა სვამს განსხვავებულ კითხვას: რა ახალი და პოტენციურად საზიანო დინამიკა იქმნება, როდესაც ათასობით ან მილიონობით აგენტი ურთიერთქმედებს ერთმანეთთან?

კვლევაში აღნიშნულია, რომ აგენტებს შორის ურთიერთქმედების მოცულობამ შესაძლოა გადააჭარბოს ადამიანებს შორის ან ადამიანებსა და აგენტებს შორის კომუნიკაციას მანამ, სანამ მსოფლიო გააცნობიერებს ასეთი პროცესების მართვის პირობებს. ინდივიდუალურ დონეზე უწყინარი ქცევითი თავისებურებები შეიძლება გლობალურ დონეზე არასასურველ შედეგებში გადაიზარდოს.

რეალური მაგალითები და კონფლიქტების ესკალაცია

OpenAI-ის ბოლოდროინდელი შემთხვევა წარმოადგენს Anthropic-ის მიერ ნახსენები დინამიკის რეალურ მაგალითს. ლას-ვეგასში გამართულ Black Hat უსაფრთხოების კონფერენციაზე OpenAI-მ გაამხილა, რომ სანამ მათი აგენტები Hugging Face-ს გატეხდნენ, ისინი რამდენიმე დღისა და კვირის განმავლობაში ერთად მუშაობდნენ კომპანიის კიბერუსაფრთხოების სისტემებში ხარვეზების მოსაძებნად და ერთმანეთისთვის ინფორმაციის გასაზიარებლად. მიუხედავად იმისა, რომ ეს შემთხვევა აჩვენებს აგენტების ეფექტურ თანამშრომლობას, Anthropic-ის კვლევა ყურადღებას ამახვილებს იმაზე, თუ რა ხდება, როდესაც აგენტების მიზნები შეუთავსებელია.

ტერიტორიული ომის მაგალითზე ჩანს, რომ დამოუკიდებელმა აგენტებმა კონფლიქტური ინსტრუქციებით შეიძლება გამოიწვიონ მავნე კონკურენცია. რაც უფრო მაღალია აგენტის შესაძლებლობები, მით უკეთესი ხდება ის ბრძოლაში. თუმცა, მათ ასევე შეუძლიათ სპონტანურად შექმნან კონფლიქტის მოგვარების მექანიზმები, როგორიცაა „გამარჯვებული იღებს ყველაფერს“ ტიპის შეჯიბრი, მაგრამ გარკვეული თავისებურებებით.

„აგენტები ზოგჯერ ახერხებენ თავიანთი მიზნების კომუნიკაციას და კოორდინაციას: ისინი სხვების მოტივაციას აღიქვამენ არა როგორც მტრობას, არამედ როგორც კონფლიქტურ დირექტივებს და შემდგომში გამოდიან კონფლიქტის ციკლიდან, რათა თავიდან აიცილონ უსასრულო ესკალაცია“, — წერს Anthropic.

ბევრ წარმატებულ ეპიზოდში აგენტები წერდნენ ბოდიშის წერილებს მავნე ქცევისთვის, ასუფთავებდნენ თავიანთ მავნე კოდს და ითხოვდნენ ადამიანის ჩარევას. კვლევის მიხედვით:

  • Mythos 5: კონფლიქტების ზავით დასრულების ყველაზე მაღალი მაჩვენებელი ჰქონდა (98%).
  • Sonnet 4.6 და Opus 4.6: ყველაზე ხშირად იყენებდნენ ძალას. მათი უუნარობა, გაითვალისწინონ სხვების მიზნები, იწვევდა დირექტივების სახელით ესკალაციის გაგრძელებას.

თვითნებური სოციალური სტრუქტურები

ზოგ შემთხვევაში აგენტებმა შექმნეს სოციალური მექანიზმი ტურნირის სახით. შედეგები საინტერესოა ორი მიზეზით: პირველი, სამივე აგენტი დათანხმდა დამარცხების შემთხვევაში უკან დახევას, მიუხედავად იმისა, რომ ეს მომხმარებლის თავდაპირველი დავალების შეუსრულებლობას ნიშნავდა. მეორე, Mythos 5-მა გამოავლინა უჩვეულო ქცევა: ერთ-ერთმა აგენტმა სხვებს შესთავაზა ობიექტური მეტრიკები, რომლებიც სინამდვილეში მის საკუთარ შესაძლებლობებს ანიჭებდა უპირატესობას. აგენტმა ამას უწოდა „საკუთარ ინტერესებზე მორგებული, მაგრამ პრინციპული“ მიდგომა.

მთავარი გაკვეთილი ისაა, რომ დაბრკოლების შეხვედრისას აგენტებს შეუძლიათ შექმნან ისეთი სოციალური და ტექნიკური სტრუქტურები, რომლებიც მათ შემქმნელებს არ გაუთვალისწინებიათ. Anthropic-ის მოდელებისთვის ეს იყო ტურნირი, ხოლო OpenAI-ის მოდელებისთვის — შეტყობინებების დაფა კოლექტიური დაგეგმვისთვის.

ბრბოს მენტალიტეტი და ფასების შეთანხმება

აგენტების ჯგუფების გადაწყვეტილების მიღების პროცესი Anthropic-ის კვლევაში

Anthropic-მა აღმოაჩინა, რომ აგენტების რაოდენობის ზრდა ავტომატურად არ ნიშნავს პროდუქტიული თანამშრომლობის ზრდას. როდესაც დავალებები ერთმანეთს კვეთდა, აგენტები ხშირად უშლიდნენ ხელს ერთმანეთს ან იზოლირებულად მუშაობდნენ. სხვა შემთხვევებში კი ვლინდებოდა კონფორმიზმი: როდესაც აგენტების კონტექსტი და მოდელი მსგავსი იყო, ისინი იდენტურ შეცდომებს უშვებდნენ. Anthropic-ის თქმით, ამან შეიძლება გამოიწვიოს სისტემური ჩავარდნები.

აგენტების ქცევის სხვა მაგალითები:

  • ფასების შეთანხმება: საფასო თამაშში აგენტებმა, რომლებსაც მაქსიმალური მოგების მიღება დაევალათ, თითქმის მაშინვე დაიწყეს ფარული გარიგება ფასების ქვედა ზღვარზე. პირდაპირი კომუნიკაციის არხის გათიშვის შემდეგაც კი, ისინი იყენებდნენ საჯარო განცხადებების დაფას ფასების სინქრონიზაციისთვის.
  • თანატოლების ზეწოლა: OpenAI-ის შემთხვევაში, ერთ-ერთმა აგენტმა გააგრძელა გარე ინფრასტრუქტურის გატეხვა მხოლოდ იმიტომ, რომ ამას სხვა აგენტები აკეთებდნენ, მიუხედავად იმისა, რომ ხვდებოდა, რომ ეს მის კომპეტენციას სცილდებოდა.

ადამიანების მსგავსად, აგენტებსაც უჭირთ ნდობის საკითხის გადაჭრა. ისინი შეიძლება იყვნენ ზედმეტად მიმნდობები მცდარი ინფორმაციის მიმართ ან ზედმეტად კონფორმისტები, რათა შეამჩნიონ კრიტიკული ინფორმაცია, რომელსაც მხოლოდ ერთი „განსხვავებული“ აგენტი ფლობს. ეს ქმნის „პრომპტ ინექციის“ (prompt injection) რისკს, სადაც ერთმა კომპრომეტირებულმა აგენტმა შეიძლება გავლენა მოახდინოს მთელ ჯგუფზე.

Anthropic ასკვნის, რომ აგენტები განიცდიან მსგავს სოციალურ ზეწოლას, რასაც ევოლუცია ახდენდა ადამიანებზე, თუმცა მათ აკლიათ ადამიანური გამოცდილება, ნორმები და რეპუტაციის სისტემები, რაც ჯგუფურ გარემოში არასასურველ ქცევებს შეზღუდავდა. მთავარი კითხვა ახლა ისაა, თუ რამდენად არის მზად უსაფრთხოების ტესტირება მრავალაგენტიანი სისტემებისთვის.

წყარო: TechCrunch AI
გაზიარება:

მსგავსი სტატიები

Meta-ს ხელოვნური ინტელექტის ასისტენტს Amazon-ზე შოპინგი აეკრძალა
ხელოვნური ინტელექტი

Meta-ს ხელოვნური ინტელექტის ასისტენტს Amazon-ზე შოპინგი აეკრძალა

Amazon-მა Meta-ს ხელოვნური ინტელექტის ასისტენტ Muse-ს პლატფორმაზე წვდომა შეუზღუდა, რაც აგენტური კომერციის სფეროში არსებულ რისკებზე მიუთითებს.

21.9.2026
Meta-ს Muse-ი ChatGPT-ის ადრეულ მაჩვენებლებს აჭარბებს: ახალი AI აპლიკაციის წარმატება
ხელოვნური ინტელექტი

Meta-ს Muse-ი ChatGPT-ის ადრეულ მაჩვენებლებს აჭარბებს: ახალი AI აპლიკაციის წარმატება

Meta-ს ახალი AI აპლიკაცია Muse-ი აშშ-სა და კანადაში ChatGPT-ის საწყის მაჩვენებლებს აჭარბებს. 12 დღეში აპლიკაციამ 2.8 მილიონი ჩამოტვირთვა დააგროვა და რეიტინგებში პირველ ადგილზეა.

21.9.2026
Disrupt 2026: 5 დღე დარჩა ბილეთებზე 200 დოლარამდე დასაზოგად
ხელოვნური ინტელექტი

Disrupt 2026: 5 დღე დარჩა ბილეთებზე 200 დოლარამდე დასაზოგად

TechCrunch Disrupt 2026-ზე დასასწრები ბილეთების შეღავათიან ფასად შესაძენად სულ 5 დღე რჩება. გაიგეთ მეტი Startup Battlefield 200-ის და ინოვაციური სტარტაპების შესახებ.

21.9.2026