რომელი ტესტები უნდა გაიაროს ყველა საუბრის პროცესმა?
ყველა საუბრის პროცესს სჭირდება წარმატებული ძირითადი გზა, მოკლე პასუხი, ერთ პასუხში რამდენიმე ველი, შესწორება, განმეორება, სიჩუმე, ფონური ხმა, საუბრის გადაფარვა, API შეცდომა და განმეორებითი მოთხოვნის უსაფრთხო დამუშავება.
| სცენარი | მოსალოდნელი ქცევა | მთავარი მტკიცებულება |
|---|---|---|
| ნორმალური პასუხი | პროცესი გადადის მხოლოდ შესაბამის შემდეგ ეტაპზე | მდგომარეობის ცვლილება და ტრანსკრიპტი |
| ორი ველი ერთად | ორივე ინახება; ზედმეტი კითხვა აღარ ისმის | სტრუქტურირებული მდგომარეობა |
| შესწორება | იცვლება მხოლოდ დასახელებული არსებული ველი | ცვლილებამდე და ცვლილების შემდეგ მდგომარეობა |
| ფონური ხმა | არ იქმნება ცრუ მომხმარებლის პასუხი | აუდიო და STT მოვლენა |
| API-ის დროის ამოწურვა | აგენტს არ გამოაქვს ყალბი წარმატება | ხელსაწყოს შედეგი და აღდგენის გზა |
| განმეორებითი თანხმობა | ქმედება სრულდება მაქსიმუმ ერთხელ | უნიკალური გასაღები და მონაცემთა ბაზის ჩანაწერი |
რატომ არ კმარა მხოლოდ სიტყვების შეცდომის მაჩვენებელი?
ტრანსკრიპტში ერთი შეცდომა ზოგჯერ არაფერს ცვლის, ხოლო სწორად დაწერილმა სიტყვამ შეიძლება პროცესის არასწორი გადასვლა გამოიწვიოს. ამიტომ ცალკე უნდა გაიზომოს მიზნის ამოცნობა, ველების სიზუსტე, დავალების დასრულება, დუბლირებული მოქმედება, დაყოვნება და აღდგენის წარმატება.
- მიზნის სიზუსტე — სწორად გაიგო თუ არა მომხმარებლის მიზანი.
- ველის სიზუსტე — სწორ ველში მოხვდა თუ არა თარიღი, დრო, სახელი ან ნომერი.
- დავალების დასრულება — რეალური ქმედება შესრულდა თუ არა შეთანხმებული წესით.
- დაყოვნება — რამდენ ხანში დაიწყო აზრიანი პასუხი მომხმარებლის დასრულების შემდეგ.
- აღდგენა — შეძლო თუ არა გაურკვევლობის ან შეცდომის შემდეგ პროცესის გაგრძელება.
როგორ მოწმდება ორმხრივი საუბარი და აზრიანი შეწყვეტა?
სისტემამ მომხმარებლის ხმა TTS-ის დროსაც უნდა მოისმინოს, მაგრამ აგენტის საუბარი მხოლოდ მაშინ შეწყვიტოს, როცა ნათქვამი მიმდინარე ან შემდეგ მოქმედებას არსებითად ცვლის. შემთხვევითი ხმა, თანხმობის გარეშე ნათქვამი სიტყვა ან შორეული ტელევიზორი საუბრის შეწყვეტის მიზეზი არ უნდა გახდეს.
ხარისხის ტესტში ცალკე იზომება ექოს გაჟონვა, ახლო და შორი ხმის სხვაობა, მომხმარებლის პირველი ბგერის მოჭრა, დაგვიანებული ტრანსკრიპტი და წინა რეპლიკის დაგვიანებით მიღება. განსაკუთრებით მნიშვნელოვანია სცენარი, როცა მომხმარებელი პასუხს აგენტის ბოლო სიტყვებამდე იწყებს.
გადაწყვეტილება ორფაზიანია: სწრაფი აკუსტიკური ფენა აგროვებს აუდიოს, ხოლო რეპლიკის მნიშვნელობის შემფასებელი წესი ადგენს, შეიცავს თუ არა ფრაზა შეწყვეტისთვის საკმარის აზრს. ეს ამცირებს როგორც დაკარგულ პასუხებს, ისე ზედმეტად ხშირ გაჩერებას.
რას ნიშნავს რეალურ გარემოში გასაშვებად მზადყოფნა?
რეალურ გარემოში მზადყოფნა ნიშნავს, რომ კრიტიკულ სცენარებს აქვს ავტომატური რეგრესიული ტესტი, შედეგი ჩანს სესიაში, ხარვეზს ჰყავს პასუხისმგებელი და აქვს სათადარიგო ქცევა, ხოლო ახალი ვერსია შეიძლება მცირე ჯგუფზე გააქტიურდეს და საჭიროებისას სწრაფად დაბრუნდეს წინაზე.
- 1
სცენარების კატალოგი
რეალური მომხმარებლის ქცევა გადაიქცევა ვერსირებულ სატესტო შემთხვევებად.
- 2
ავტომატური სიმულაცია
სხვადასხვა პასუხი და ტექნიკური შეცდომა რეგულარულად ეშვება ერთსა და იმავე კონტრაქტზე.
- 3
შედეგის შედარება
მოწმდება მდგომარეობა, ხელსაწყოს გამოძახება, მონაცემის შენახვა და მომხმარებლისთვის ნათქვამი საბოლოო პასუხი.
- 4
ეტაპობრივი გამოშვება
ახალი საუბრის პროცესი თავდაპირველად ზარების შეზღუდულ ნაწილზე ირთვება, მაჩვენებლების დაკვირვებითა და წინა ვერსიაზე დაბრუნების მზადყოფნით.
ოფიციალური წყაროები და დამატებითი კითხვა
ტექნიკური განმარტებები გადამოწმებულია პირველწყაროებთან. ბმულები იხსნება შესაბამისი პროექტის ოფიციალურ დოკუმენტაციაში.
- Pipecat Flows API-ის მიმოხილვა — Pipecat-ის დოკუმენტაცია
FlowManager-ის, კვანძების კონფიგურაციისა და მდგომარეობის მართვის ოფიციალური API მიმოხილვა.
- AI რისკების მართვის ჩარჩო 1.0 — NIST
AI სისტემების რისკის მართვის ნებაყოფლობითი, სექტორულად ნეიტრალური ჩარჩო.