როგორ გადადის სატელეფონო ხმა რეალურ მოქმედებამდე?
პროცესი ექვს ურთიერთდაკავშირებულ ფენად მუშაობს: ტელეფონია იღებს ზარს, აუდიო მუშავდება, STT ქმნის ტექსტს, საუბრის მართვის ფენა ადგენს მიმდინარე ნაბიჯს, ბიზნესსერვისი ასრულებს ქმედებას და TTS პასუხს ხმით აბრუნებს.
- 1
ზარის მიღება
SIP ნომერი ზარს LiveKit-ის ოთახში და შესაბამის ხმოვან აგენტთან აგზავნის.
- 2
აუდიოს დამუშავება
სისტემა მართავს პაკეტების მოძრაობას, სიჩუმეს, საუბრის დასაწყისსა და ფონური ხმაურის დამუშავებას.
- 3
საუბრის ამოცნობა
STT აუდიოს ტექსტად გარდაქმნის; რიცხვები, თარიღები და სახელები დამატებით ვალიდაციას საჭიროებს.
- 4
პროცესის გადაწყვეტილება
მიმდინარე ეტაპი განსაზღვრავს, რომელი პასუხია მოსალოდნელი და რომელი მოქმედებაა დაშვებული.
- 5
რეალური ქმედება
კალენდარი, CRM, ვებჰუკი ან სხვა API ასრულებს მხოლოდ შემოწმებულ და დადასტურებულ მოქმედებას.
- 6
პასუხი და მტკიცებულება
TTS პასუხს აბრუნებს, ხოლო სისტემა ინახავს შედეგს, ეტაპებს, დაყოვნებასა და შეცდომებს.
რატომ არ არის მხოლოდ კარგი LLM საკმარისი?
LLM-ს შეუძლია ბუნებრივი ფრაზის გაგება, მაგრამ ბიზნესქმედება არ უნდა დაეყრდნოს თავისუფალ ტექსტს. კრიტიკული ველები უნდა გაიაროს ტიპის შემოწმება, კალენდრის ან CRM-ის ცოცხალი მოთხოვნა, მომხმარებლის დადასტურება და იდემპოტენტური ჩაწერა.
მაგალითად, ფრაზა „პარასკევს ორის ნახევარზე“ ჯერ უნდა გადაიქცეს თბილისის დროის ზუსტ მნიშვნელობად, შემდეგ შემოწმდეს ხელმისაწვდომობა და მხოლოდ ამის შემდეგ გახდეს ჯავშნის კანდიდატი. მოდელის დარწმუნებული ტონი არ არის მონაცემის სისწორის მტკიცებულება.
OMO ამ განსხვავებას ნდობის მოდელით მართავს: მოსმენა, შემოწმება, დადასტურება, ქმედება და მტკიცებულება. თუ ერთ-ერთი რგოლი ვერ სრულდება, სისტემა აზუსტებს ან პროცესს ადამიანს გადასცემს.
რა არის ქართული საუბრის ყველაზე რთული ადგილები?
ქართულ სატელეფონო დიალოგში ყველაზე მეტი კონტექსტი თარიღს, დროს, საკუთარ სახელებს, თანხმობის მოკლე ფორმებსა და საუბრის შუაში გაკეთებულ შესწორებას სჭირდება. თითოეული მათგანი უნდა შეფასდეს მიმდინარე ეტაპთან ერთად და არა იზოლირებული სიტყვით.
| სიგნალი | რისკი | სწორი კონტროლი |
|---|---|---|
| „თერთმეტის ნახევარი“ | 11:30-ად არასწორი ინტერპრეტაცია | ქართული დროის ნორმალიზაცია: 10:30 |
| სახელი და გვარი | მსგავსი ჟღერადობის სახელის მიღება | ეტაპობრივი ამოცნობა, სახელების ლექსიკონი და მოკლე გადამოწმება |
| „დიახ“ | ფონურ ხმასთან არევა | მოკლე თანხმობის ცალკე კლასიფიკაცია და მიმდინარე კითხვასთან მიბმა |
| შესწორება | ახალი ფრაზის ძველი პასუხის გაგრძელებად მიღება | ცვლილების განზრახვის დადასტურება და მხოლოდ დასახელებული ველის განახლება |
როგორ შეაფასოთ ხმოვანი აგენტი დემოს მიღმა?
შეფასება უნდა მოიცავდეს არა მხოლოდ სასიამოვნო ხმას, არამედ დასრულებულ ქმედებას, ზუსტ მონაცემს, პასუხის დაყოვნებას, შესწორების მართვას, ფონურ ხმაურსა და შეცდომის შემდეგ აღდგენას. ერთი წარმატებული დემო რეალურ გარემოში მზადყოფნას არ ამტკიცებს.
- შეამოწმეთ ნორმალური, მოკლე, გრძელი და ერთდროულად რამდენიმე ველის შემცველი პასუხები.
- ცადეთ აზრის შეცვლა, სიჩუმე, შეწყვეტა, ტელევიზორის ხმა და ცუდი კავშირი.
- შეადარეთ აგენტის ნათქვამი რეალურად შექმნილ ჩანაწერს ან CRM მოვლენას.
- მოითხოვეთ ზარის აუდიო, ტრანსკრიპტი, ეტაპები და ტექნიკური დროები ერთ სესიაში.
ოფიციალური წყაროები და დამატებითი კითხვა
ტექნიკური განმარტებები გადამოწმებულია პირველწყაროებთან. ბმულები იხსნება შესაბამისი პროექტის ოფიციალურ დოკუმენტაციაში.
- ტელეფონიის შესავალი — LiveKit-ის დოკუმენტაცია
LiveKit-ის ოფიციალური მიმოხილვა ტრადიციული ტელეფონიისა და რეალურ დროში პლატფორმის დაკავშირებაზე.
- Pipecat-ის შესავალი — Pipecat-ის დოკუმენტაცია
Pipecat-ის ოფიციალური აღწერა ხმოვანი AI-ის მონაცემთა ნაკადისა და აუდიო სერვისების ორკესტრაციაზე.