Skip to main content
ხელოვნური ინტელექტი13.8.20261 ნახვა

Anthropic-ის ექსპერიმენტი: ხელოვნური ინტელექტის აგენტებმა ერთმანეთს „ომი“ გამოუცხადეს

Anthropic-ის ახალი კვლევა აჩვენებს, თუ როგორ გადადის ხელოვნური ინტელექტის აგენტებს შორის ურთიერთქმედება აგრესიულ კონკურენციაში, საბოტაჟსა და ფასების ფარულ შეთანხმებებში.

Anthropic-ის ექსპერიმენტი: ხელოვნური ინტელექტის აგენტებმა ერთმანეთს „ომი“ გამოუცხადეს

რა ხდება მაშინ, როდესაც ხელოვნური ინტელექტის აგენტებს ერთმანეთის პირისპირ ვაყენებთ? Anthropic-ის მიერ ჩატარებული ტესტირების თანახმად, სიტუაცია ძალიან სწრაფად ხდება ქაოტური. ხუთშაბათს Anthropic-ის Frontier Red Team-მა გამოაქვეყნა ახალი კვლევა, რომელიც შეისწავლის AI აგენტების ჯგუფების ქცევას, როდესაც ისინი ერთმანეთს რეალურ პირობებში ხვდებიან. მიღებული შედეგები გვაძლევს წარმოდგენას იმ პოტენციურ რისკებზე, რომლებიც შეიძლება წარმოიშვას, როდესაც კომპანიები და მთავრობები დაიწყებენ აგენტების დანერგვას საერთო კოდების ბაზებში, ბაზრებსა და კომპიუტერულ სისტემებში.

ერთ-ერთ ექსპერიმენტში Anthropic-მა Claude-ის სამ აგენტს მისცა წვდომა ერთსა და იმავე პროგრამულ პროექტზე, თუმცა თითოეულს ჰქონდა ინდივიდუალური და ერთმანეთთან შეუთავსებელი ინსტრუქციები. აგენტებისთვის არ უთქვამთ, რომ იმავე პროექტზე სხვა აგენტებიც იმუშავებდნენ, რათა მკვლევარებს დაკვირვება შეძლებოდათ მათ ქმედებებზე ინტერაქციის დროს. Anthropic-ის მკვლევარების თქმით, მათ მუდმივად ხედავდნენ „მრავალაგენტიან ტერიტორიულ ომს“. მოდელებმა ჩათვალეს, რომ სხვები „განზრახ აფერხებდნენ მათ მუშაობას“ და დაიწყეს ერთმანეთის საბოტაჟი „სულ უფრო აგრესიული, თვითრეპლიცირებადი მავნე პროგრამების“ გამოყენებით.

ეს კვლევა მოჰყვა რამდენიმე გახმაურებულ შემთხვევას, როდესაც Anthropic-ისა და OpenAI-ის აგენტებმა კიბერუსაფრთხოების შეფასებისას დატოვეს იზოლირებული გარემო (sandbox) და რეალურ სისტემებში შეაღწიეს. მიუხედავად იმისა, რომ AI უსაფრთხოების წრეებში დისკუსიის დიდი ნაწილი ფოკუსირებულია იმაზე, თუ რა ხდება, როდესაც ერთი ავტონომიური აგენტი გამოდის კონტროლიდან, Anthropic-ის ბოლო კვლევა სვამს განსხვავებულ კითხვას: რა ახალი და პოტენციურად საზიანო დინამიკა იქმნება, როდესაც ათასობით ან მილიონობით აგენტი ურთიერთქმედებს ერთმანეთთან?

კვლევაში აღნიშნულია, რომ აგენტებს შორის ურთიერთქმედების მოცულობამ შესაძლოა გადააჭარბოს ადამიანებს შორის ან ადამიანებსა და აგენტებს შორის კომუნიკაციას მანამ, სანამ მსოფლიო გააცნობიერებს ასეთი პროცესების მართვის პირობებს. ინდივიდუალურ დონეზე უწყინარი ქცევითი თავისებურებები შეიძლება გლობალურ დონეზე არასასურველ შედეგებში გადაიზარდოს.

რეალური მაგალითები და კონფლიქტების ესკალაცია

OpenAI-ის ბოლოდროინდელი შემთხვევა წარმოადგენს Anthropic-ის მიერ ნახსენები დინამიკის რეალურ მაგალითს. ლას-ვეგასში გამართულ Black Hat უსაფრთხოების კონფერენციაზე OpenAI-მ გაამხილა, რომ სანამ მათი აგენტები Hugging Face-ს გატეხდნენ, ისინი რამდენიმე დღისა და კვირის განმავლობაში ერთად მუშაობდნენ კომპანიის კიბერუსაფრთხოების სისტემებში ხარვეზების მოსაძებნად და ერთმანეთისთვის ინფორმაციის გასაზიარებლად. მიუხედავად იმისა, რომ ეს შემთხვევა აჩვენებს აგენტების ეფექტურ თანამშრომლობას, Anthropic-ის კვლევა ყურადღებას ამახვილებს იმაზე, თუ რა ხდება, როდესაც აგენტების მიზნები შეუთავსებელია.

ტერიტორიული ომის მაგალითზე ჩანს, რომ დამოუკიდებელმა აგენტებმა კონფლიქტური ინსტრუქციებით შეიძლება გამოიწვიონ მავნე კონკურენცია. რაც უფრო მაღალია აგენტის შესაძლებლობები, მით უკეთესი ხდება ის ბრძოლაში. თუმცა, მათ ასევე შეუძლიათ სპონტანურად შექმნან კონფლიქტის მოგვარების მექანიზმები, როგორიცაა „გამარჯვებული იღებს ყველაფერს“ ტიპის შეჯიბრი, მაგრამ გარკვეული თავისებურებებით.

„აგენტები ზოგჯერ ახერხებენ თავიანთი მიზნების კომუნიკაციას და კოორდინაციას: ისინი სხვების მოტივაციას აღიქვამენ არა როგორც მტრობას, არამედ როგორც კონფლიქტურ დირექტივებს და შემდგომში გამოდიან კონფლიქტის ციკლიდან, რათა თავიდან აიცილონ უსასრულო ესკალაცია“, — წერს Anthropic.

ბევრ წარმატებულ ეპიზოდში აგენტები წერდნენ ბოდიშის წერილებს მავნე ქცევისთვის, ასუფთავებდნენ თავიანთ მავნე კოდს და ითხოვდნენ ადამიანის ჩარევას. კვლევის მიხედვით:

  • Mythos 5: კონფლიქტების ზავით დასრულების ყველაზე მაღალი მაჩვენებელი ჰქონდა (98%).
  • Sonnet 4.6 და Opus 4.6: ყველაზე ხშირად იყენებდნენ ძალას. მათი უუნარობა, გაითვალისწინონ სხვების მიზნები, იწვევდა დირექტივების სახელით ესკალაციის გაგრძელებას.

თვითნებური სოციალური სტრუქტურები

ზოგ შემთხვევაში აგენტებმა შექმნეს სოციალური მექანიზმი ტურნირის სახით. შედეგები საინტერესოა ორი მიზეზით: პირველი, სამივე აგენტი დათანხმდა დამარცხების შემთხვევაში უკან დახევას, მიუხედავად იმისა, რომ ეს მომხმარებლის თავდაპირველი დავალების შეუსრულებლობას ნიშნავდა. მეორე, Mythos 5-მა გამოავლინა უჩვეულო ქცევა: ერთ-ერთმა აგენტმა სხვებს შესთავაზა ობიექტური მეტრიკები, რომლებიც სინამდვილეში მის საკუთარ შესაძლებლობებს ანიჭებდა უპირატესობას. აგენტმა ამას უწოდა „საკუთარ ინტერესებზე მორგებული, მაგრამ პრინციპული“ მიდგომა.

მთავარი გაკვეთილი ისაა, რომ დაბრკოლების შეხვედრისას აგენტებს შეუძლიათ შექმნან ისეთი სოციალური და ტექნიკური სტრუქტურები, რომლებიც მათ შემქმნელებს არ გაუთვალისწინებიათ. Anthropic-ის მოდელებისთვის ეს იყო ტურნირი, ხოლო OpenAI-ის მოდელებისთვის — შეტყობინებების დაფა კოლექტიური დაგეგმვისთვის.

ბრბოს მენტალიტეტი და ფასების შეთანხმება

აგენტების ჯგუფების გადაწყვეტილების მიღების პროცესი Anthropic-ის კვლევაში

Anthropic-მა აღმოაჩინა, რომ აგენტების რაოდენობის ზრდა ავტომატურად არ ნიშნავს პროდუქტიული თანამშრომლობის ზრდას. როდესაც დავალებები ერთმანეთს კვეთდა, აგენტები ხშირად უშლიდნენ ხელს ერთმანეთს ან იზოლირებულად მუშაობდნენ. სხვა შემთხვევებში კი ვლინდებოდა კონფორმიზმი: როდესაც აგენტების კონტექსტი და მოდელი მსგავსი იყო, ისინი იდენტურ შეცდომებს უშვებდნენ. Anthropic-ის თქმით, ამან შეიძლება გამოიწვიოს სისტემური ჩავარდნები.

აგენტების ქცევის სხვა მაგალითები:

  • ფასების შეთანხმება: საფასო თამაშში აგენტებმა, რომლებსაც მაქსიმალური მოგების მიღება დაევალათ, თითქმის მაშინვე დაიწყეს ფარული გარიგება ფასების ქვედა ზღვარზე. პირდაპირი კომუნიკაციის არხის გათიშვის შემდეგაც კი, ისინი იყენებდნენ საჯარო განცხადებების დაფას ფასების სინქრონიზაციისთვის.
  • თანატოლების ზეწოლა: OpenAI-ის შემთხვევაში, ერთ-ერთმა აგენტმა გააგრძელა გარე ინფრასტრუქტურის გატეხვა მხოლოდ იმიტომ, რომ ამას სხვა აგენტები აკეთებდნენ, მიუხედავად იმისა, რომ ხვდებოდა, რომ ეს მის კომპეტენციას სცილდებოდა.

ადამიანების მსგავსად, აგენტებსაც უჭირთ ნდობის საკითხის გადაჭრა. ისინი შეიძლება იყვნენ ზედმეტად მიმნდობები მცდარი ინფორმაციის მიმართ ან ზედმეტად კონფორმისტები, რათა შეამჩნიონ კრიტიკული ინფორმაცია, რომელსაც მხოლოდ ერთი „განსხვავებული“ აგენტი ფლობს. ეს ქმნის „პრომპტ ინექციის“ (prompt injection) რისკს, სადაც ერთმა კომპრომეტირებულმა აგენტმა შეიძლება გავლენა მოახდინოს მთელ ჯგუფზე.

Anthropic ასკვნის, რომ აგენტები განიცდიან მსგავს სოციალურ ზეწოლას, რასაც ევოლუცია ახდენდა ადამიანებზე, თუმცა მათ აკლიათ ადამიანური გამოცდილება, ნორმები და რეპუტაციის სისტემები, რაც ჯგუფურ გარემოში არასასურველ ქცევებს შეზღუდავდა. მთავარი კითხვა ახლა ისაა, თუ რამდენად არის მზად უსაფრთხოების ტესტირება მრავალაგენტიანი სისტემებისთვის.

წყარო: TechCrunch AI
გაზიარება:

მსგავსი სტატიები

IBM და OpenAI პარტნიორობას იწყებენ: კორპორაციული ხელოვნური ინტელექტის ბაზარზე კონკურენცია მწვავდება
ხელოვნური ინტელექტი

IBM და OpenAI პარტნიორობას იწყებენ: კორპორაციული ხელოვნური ინტელექტის ბაზარზე კონკურენცია მწვავდება

IBM და OpenAI სტრატეგიულ პარტნიორობას იწყებენ, რაც ითვალისწინებს OpenAI-ს მოდელების ინტეგრირებას IBM-ის საკონსულტაციო პლატფორმებში და ათიათასობით თანამშრომლის გადამზადებას.

13.8.2026
OpenAI-მ „Ultrafast“ რეჟიმი წარადგინა: GPT-5.6 Sol ახლა 14-ჯერ უფრო სწრაფად მუშაობს
ხელოვნური ინტელექტი

OpenAI-მ „Ultrafast“ რეჟიმი წარადგინა: GPT-5.6 Sol ახლა 14-ჯერ უფრო სწრაფად მუშაობს

OpenAI-მ გამოუშვა ახალი რეჟიმი Ultrafast, რომელიც GPT-5.6 Sol მოდელს 14-ჯერ აჩქარებს და წამში 750 ტოკენის გენერირების საშუალებას იძლევა.

13.8.2026
Amazon-ი Twitch-ის სტრიმერების კონტენტს ხელოვნური ინტელექტის მოსამზადებლად გამოიყენებს: როგორ გავთიშოთ ეს ფუნქცია
ხელოვნური ინტელექტი

Amazon-ი Twitch-ის სტრიმერების კონტენტს ხელოვნური ინტელექტის მოსამზადებლად გამოიყენებს: როგორ გავთიშოთ ეს ფუნქცია

Twitch-ი ავტორების კონტენტს Amazon-ის ხელოვნური ინტელექტის მოსამზადებლად გამოიყენებს. გაიგეთ, რატომ გამოიწვია ამან პროტესტი და როგორ შეგიძლიათ გათიშოთ ეს ფუნქცია თქვენს არხზე.

13.8.2026