Skip to main content
ხელოვნური ინტელექტი11.10.2026• 1 ნახვა

ექსპერტების აზრით, ხმოვან ხელოვნურ ინტელექტს ChatGPT-ის მსგავსი გარღვევის მომენტისთვის ჯერ არ მიუღწევია

ხმოვანი ხელოვნური ინტელექტის ექსპერტები განიხილავენ, რატომ ვერ აღწევს ტექნოლოგია ChatGPT-ის დონის გარღვევას და რა გამოწვევები არსებობს ენის აღქმისა და ნდობის კუთხით.

ექსპერტების აზრით, ხმოვან ხელოვნურ ინტელექტს ChatGPT-ის მსგავსი გარღვევის მომენტისთვის ჯერ არ მიუღწევია

თეორია იმის შესახებ, რომ ხმოვანი ინტერფეისი ტექნოლოგიების მომავალია, სულ უფრო მეტ აქტუალობას იძენს. ინვესტორები მილიარდობით დოლარს აბანდებენ ხმოვანი ხელოვნური ინტელექტის (AI) სტარტაპებში, რომლებიც მუშაობენ სხვადასხვა მიმართულებით — მოდელების შემქმნელებიდან და კორპორატიული მომხმარებელთა მომსახურების პროვაიდერებიდან დაწყებული, შეხვედრების ჩამწერებითა და AI-ზე დაფუძნებული კარნახის სისტემებით დასრულებული.

ყოველ კვირას ბაზარზე გამოდის ახალი მოდელი ან ინსტრუმენტი, რომელიც აცხადებს, რომ ადამიანის მსგავსი ხმა აქვს და მასთან საუბარი ბუნებრივია. თუმცა, რეალობა შესაძლოა სულ სხვაგვარი იყოს. კორპორატიული ხმოვანი AI პლატფორმის, PolyAI-ს ტექნიკური დირექტორი (CTO) შონ ვენი მიიჩნევს, რომ მიუხედავად „full-duplex“ მოდელების გამოჩენისა — რომლებსაც შეუძლიათ საუბარი თქვენი მოსმენის პარალელურად — ხმოვან AI-ს ჯერ კიდევ არ ჰქონია თავისი „ChatGPT მომენტი“.

„ჩვენ მივაღწიეთ full-duplex მოდელების განვითარების ეტაპს. შემდეგი გამოწვევაა ლოგიკური მსჯელობის (reasoning) დაჩქარება, რათა მოდელებმა პასუხები სწრაფად მოიძიონ და საუბარი ბუნებრივად წარიმართოს“, — განაცხადა ვენმა გასულ თვეში გამართულ HumanX კონფერენციაზე. მისივე თქმით, მომხმარებელთა მომსახურების AI აგენტები არ უნდა ჟღერდნენ რობოტივით და მათ მომხმარებელს უნდა გაუჩინონ იმის განცდა, რომ პრობლემის გადაჭრა შეუძლიათ.

ვენი ვარაუდობს, რომ შემდეგი ეტაპი ოდნავ განსხვავებული იქნება: „როდესაც ხმა საკმარისად დაიხვეწება და მომხმარებელი მზად იქნება პირველი ორი-სამი ფრაზით ჩაერთოს დიალოგში, მათ ნდობა უჩნდებათ. დროთა განმავლობაში ისინი იგრძნობენ, რომ ადამიანთან დაკავშირება აღარ არის საჭირო, თუკი აგენტს მათი პრობლემის მოგვარება შეუძლია“.

ავტომატიზაცია და ციფრული ტყუპები

შეხვედრების ჩამწერი პლატფორმის, Otter-ის მარკეტინგის ხელმძღვანელი (CMO) ალექს გეი მიიჩნევს, რომ სპიკერის იდენტიფიცირება, განზრახვის ამოცნობა და ამ ყველაფრის ორგანიზაციულ ცოდნასთან დაკავშირება ავტომატიზაციის ჩართვის საკვანძო ნაბიჯია. კომპანია ასევე მუშაობს „ციფრულ ტყუპებზე“, რომლებმაც შესაძლოა ადამიანები შეხვედრებზე ჩაანაცვლონ.

ამ ტექნოლოგიისთვის, გეის თქმით, უმნიშვნელოვანესია, რომ გამომავალი ხმა გადმოსცემდეს იმავე ემოციურ გამომეტყველებას, რასაც ადამიანი შეხვედრისას. „თუ დაფიქრდებით შეხვედრებზე, საუკეთესო საუბრები მაშინ იმართება, როდესაც შეგიძლიათ დებატები, სტრატეგიული დისკუსიები და როდესაც გრძნობთ, რომ ამ ყველაფრის საფუძველი ურთიერთობაა. თუ ამის მიღწევა ავატართან შეუძლებელია, მაშინ ის უბრალოდ კითხვა-პასუხის ჩატბოტია“, — აღნიშნა გეიმ.

ხმოვანი AI-ს გაგების უნარი და გამჭვირვალობა

მიუხედავად იმისა, რომ ხმოვანი AI მოდელები გაუმჯობესდა, ასისტენტებს ხშირად მაინც უჭირთ მომხმარებლის გაგება, ან შეხვედრების ჩამწერი პროგრამები არასწორ ტრანსკრიპტს ან შეჯამებას აკეთებენ. ვენი ფიქრობს, რომ ASR (მეტყველების ავტომატური ამოცნობა) მოდელებს ხშირად გამორჩებათ მნიშვნელოვანი საკვანძო სიტყვები, რაც სრული კონტექსტის აღქმის პრობლემას ქმნის.

Otter-ის წარმომადგენელი ეთანხმება ამ მოსაზრებას და დასძენს, რომ კომპანია მუდმივად მუშაობს ტრანსკრიფციის ხარისხის გაუმჯობესებაზე. მისი თქმით, ენა არის ერთ-ერთი სფერო, სადაც ხმოვან მოდელებს განვითარება სჭირდებათ.

„Otter-ისთვის ტრანსკრიფცია არასოდეს ყოფილა საბოლოო წერტილი. ეს იყო მხოლოდ ფენა, რომელზეც პროდუქტიულობის გაზრდა დავაშენეთ. თუმცა, თუ ორიგინალი ტრანსკრიფცია არ არის ზუსტი, ყველა შემდგომი ქმედება მცდარი ხდება. როგორც კი სისტემა არასწორ ნაბიჯს გადადგამს, პლატფორმის მიმართ ნდობას კარგავთ. ჩვენთვის კრიტიკულად მნიშვნელოვანია ASR მოდელის მუდმივი გაუმჯობესება, რადგან მასზე დამოკიდებული ყველა შემდგომი პროცესი მნიშვნელოვანია“, — განაცხადა გეიმ.

გამჭვირვალობის საკითხი

ახალ ხმოვან ინსტრუმენტებთან დაკავშირებით ასევე დგას გამჭვირვალობის საკითხი. ინსტრუმენტებმა მომხმარებელს უნდა აცნობონ, რომ ხდება მათი ჩაწერა ან რომ ისინი ხელოვნურ ინტელექტს ესაუბრებიან. Otter-ის განცხადებით, მათ სურთ ნდობის მოპოვება, ამიტომ იმ შეხვედრებზეც კი, სადაც ბოტი არ იმყოფება, განიხილავენ მეთოდებს, რათა ჩატში ყველას ეცნობოს შეხვედრის ჩაწერის შესახებ.

PolyAI-ს წარმომადგენელი, შონ ვენი ასევე ხაზს უსვამს, რომ კორპორატიული ზარებისას აუცილებელია იმის დაფიქსირება, რომ ადამიანი ხელოვნურ ინტელექტს ესაუბრება.

როდესაც პროდუქტს ჩვენს სტატიებში მოცემული ბმულების საშუალებით ყიდულობთ, შესაძლოა მცირე საკომისიო გამოვიმუშაოთ. ეს გავლენას არ ახდენს ჩვენს სარედაქციო დამოუკიდებლობაზე.

წყარო: TechCrunch AI
გაზიარება:

მსგავსი სტატიები

შეძლებს თუ არა AI ინდუსტრია მონაცემთა ცენტრების მოწინააღმდეგეების დარწმუნებას კონფიდენციალურობის ხელშეკრულებებზე უარის თქმით?
ხელოვნური ინტელექტი

შეძლებს თუ არა AI ინდუსტრია მონაცემთა ცენტრების მოწინააღმდეგეების დარწმუნებას კონფიდენციალურობის ხელშეკრულებებზე უარის თქმით?

Amazon და Microsoft მონაცემთა ცენტრების მშენებლობისას საიდუმლო მოლაპარაკებებზე უარს ამბობენ. დაეხმარება თუ არა ეს ნაბიჯი ტექნოლოგიურ გიგანტებს საზოგადოების ნდობის მოპოვებაში?

11.10.2026
Disrupt 2026-ის დაწყებამდე 48 საათზე ნაკლები რჩება: რას უნდა ველოდოთ ტექნოლოგიურ კონფერენციაზე
ხელოვნური ინტელექტი

Disrupt 2026-ის დაწყებამდე 48 საათზე ნაკლები რჩება: რას უნდა ველოდოთ ტექნოლოგიურ კონფერენციაზე

TechCrunch Disrupt 2026-ის დაწყებამდე 48 საათზე ნაკლები რჩება. გაიგეთ მეტი 200-ზე მეტი სესიის, Startup Battlefield-ისა და სპეციალური ფასდაკლებების შესახებ.

11.10.2026
სატია ნადელა: ხელოვნური ინტელექტის მოდელებს „საავარიო მუხრუჭი“ სჭირდებათ
ხელოვნური ინტელექტი

სატია ნადელა: ხელოვნური ინტელექტის მოდელებს „საავარიო მუხრუჭი“ სჭირდებათ

Microsoft-ის აღმასრულებელი დირექტორი სატია ნადელა ხელოვნური ინტელექტის უსაფრთხოების ახალ ხედვას წარადგენს, რომელიც მოდელების მართვისა და გადაუდებელი გათიშვის მექანიზმებს გულისხმობს.

11.10.2026