ტრანსკრიპტი ტექსტია — არა ბიზნესგადაწყვეტილება
STT-ის ამოცანაა აუდიოდან ტექსტის მიღება. „ხვალ ოთხის ნახევარზე“ შეიძლება სწორად ჩაიწეროს, თუმცა კონკრეტული თარიღი, 15:30-ის კონტექსტი და თავისუფალი დრო სხვა ფენებმა უნდა გადაამოწმონ. ამოცნობის წარმატება დაჯავშნის ნებართვა არ არის.
ორიგინალი ტექსტი და ნორმალიზებული ველი ცალ-ცალკე შეინახეთ. ასე გამოჩნდება, ხარვეზი მოსმენისას მოხდა, ინტერპრეტაციისას თუ ბიზნესწესის გამოყენებისას. მოდელმა გაურკვეველი სახელის „გამოსწორებით“ სხვა ადამიანი არ უნდა გამოიგონოს.
ნაწილობრივი და საბოლოო ტექსტი ერთმანეთისგან გამიჯნეთ
ნაკადური ამოცნობა ტექსტს საუბრის მიმდინარეობისას აბრუნებს. ნაწილობრივი შედეგი შეიძლება შეიცვალოს, რადგან მომდევნო ბგერები წინა სიტყვას აზუსტებს. საბოლოო შედეგიც არ არის უტყუარი; ის მხოლოდ ამ მონაკვეთის დასრულებულ ამოცნობას აღნიშნავს.
მოვლენას უნდა ახლდეს მონაკვეთისა და რიგის იდენტიფიკაცია. დაგვიანებულმა ნაწილობრივმა ტექსტმა უკვე გასწორებული ან დადასტურებული მნიშვნელობა არ უნდა გადააწეროს. ეს მდგომარეობის მართვის პასუხისმგებლობაა და მხოლოდ STT მოდელის არჩევით არ წყდება.
| მოვლენა | ორიგინალი ტექსტი | ბიზნესმნიშვნელობა |
|---|---|---|
| ნაწილობრივი | „ხვალ სამ…“ | ჯერ დროის დაუდასტურებელი კანდიდატი |
| საბოლოო | „ხვალ სამზე, არა, ოთხზე“ | ინტერპრეტაციამ უნდა გაითვალისწინოს შესწორება |
| კონტექსტური შემოწმება | უცვლელი საბოლოო ტრანსკრიპტი | ცნობილ თარიღზე 16:00 მხოლოდ შესაბამისი დღის კონტექსტით |
| ძველი ნაწილობრივი მოვლენა | „ხვალ სამზე“ | ძველმა მოვლენამ ახალი დრო არ უნდა შეცვალოს |
რა არის განსაკუთრებული ქართულ ზარებში?
ტესტში ჩართეთ სახელის ბრუნვები, გვარები, მოკლე თანხმობა, თანხები, ტელეფონის ციფრები და ქართული საათის ფორმები. მაგალითად, „ლუკასთან“ სახელის კონტექსტს შეიცავს; „ოთხის ნახევარი“ საღამოს კონტექსტში 15:30-ს ნიშნავს და არა 16:30-ს.
ქართული და უცხოენოვანი ტერმინების მონაცვლეობა, ბრენდის სახელები და უცნობი გვარები ცალკე ჯგუფებად შეაფასეთ. კრიტიკული ველი უნდა გადამოწმდეს ფორმატით, დაშვებული კატალოგით ან მომხმარებელთან დაზუსტებით. ჟღერადობის მსგავსება პიროვნების იდენტიფიკაციას არ უდრის.
- ციფრების მიმდევრობა შეადარეთ ზუსტად და არა მხოლოდ წინადადების საერთო აზრით.
- სახელების ლექსიკონმა შეიძლება დაეხმაროს ამოცნობას, მაგრამ მხარდაჭერა კონკრეტულ მომწოდებელზეა დამოკიდებული.
- არასწორად ამოცნობილი მოკლე „კი“ დაუდასტურებელ მოქმედებად არ უნდა იქცეს.
ტელეფონი, მიკროფონი და ფონური საუბარი სხვადასხვა პირობებია
8 kHz სატელეფონო ჩანაწერს სუფთა მიკროფონთან ერთნაირი პირობები არ აქვს. მნიშვნელოვანია კოდეკი, შეკუმშვა, პაკეტის დაკარგვა, ექო და საუბრის გადაფარვა. ეს ტესტის პირობებია და არა რომელიმე სისტემის სიზუსტის გაზომილი შედეგი.
VAD ადგენს საუბრის აქტივობას; endpointing ეხმარება სისტემას საუბრის მონაკვეთის დასასრულის არჩევაში. არცერთი თავისთავად არ ადგენს, ეკუთვნის თუ არა ხმა აბონენტს ან ტელევიზორს. ხმაურის შემცირებამ შეიძლება სასარგებლო სიტყვაც დააზიანოს, ამიტომ მოსაუბრის დაცვისა და ფონის ფილტრაციის ეფექტი ერთად უნდა შემოწმდეს.
როგორ შევადაროთ ამოცნობის ხარისხი?
გამოიყენეთ ნებართვით შეგროვებული ან სპეციალურად ჩაწერილი ტესტი, ხელით გადამოწმებული ტრანსკრიპტით. აღწერეთ მოსაუბრეთა რაოდენობა, ჩანაწერის პირობები, აქცენტები, ხანგრძლივობა და კრიტიკული ველების წილი. ციფრები მხოლოდ რეალური გაზომვის შემდეგ გამოაქვეყნეთ.
WER ითვლის სიტყვების ჩანაცვლებას, გამოტოვებასა და დამატებას ეტალონის სიტყვების რაოდენობასთან მიმართებით. CER იმავე ტიპის შეცდომებს სიმბოლოებზე ითვლის. დაბალი საერთო შეცდომა არ ამტკიცებს, რომ კონკრეტული ნომერი ან დრო სწორია, ამიტომ ველისა და ამოცანის სიზუსტეც ცალკე გაზომეთ.
| საზომი | რა მოწმდება |
|---|---|
| WER / CER | ტექსტის განსხვავება შეთანხმებული ნორმალიზაციით მომზადებულ ეტალონთან |
| კრიტიკული ველი | სახელის, თარიღის, დროისა და ნომრის ზუსტი ამოცნობა |
| ამოცანის შედეგი | ვალიდაციის შემდეგ სწორი მოქმედება ან სწორი დაზუსტება |
| დაყოვნება | აუდიოს მონაკვეთის დასრულებიდან საბოლოო ტრანსკრიპტამდე დრო მილიწამებში |
| გაურკვევლობა | შეცდომისას რამდენჯერ დაზუსტდა მნიშვნელობა ცრუ თავდაჯერების ნაცვლად |
კომპონენტის ინტეგრაცია და ცალკე პროდუქტი ერთი არ არის
ამ გვერდზე STT ახსნილია ხმოვანი პროცესის კომპონენტად. მისი ინტეგრაცია არ ნიშნავს, რომ OMO საბაზო მეტყველების მოდელს ფლობს ან საჯარო ტრანსკრიფციის API-ს, ფაილების მასობრივ დამუშავებასა თუ მოდელის გადამზადების მომსახურებას ცალკე ყიდის.
კონკრეტული მომწოდებლის ენის მხარდაჭერა, წვდომა და შეზღუდვები დანერგვისას მოწმდება. ერთი წარმატებული დემო ვერ ცვლის წარმომადგენლობით სატელეფონო ტესტს და არ იძლევა ყველა სახელის ან ხმაურიანი ფრაზის სწორად ამოცნობის გარანტიას.
ხშირი კითხვები
STT და გაგება ერთი და იგივეა?
არა. STT ქმნის ტექსტს; კონტექსტი, ველების მნიშვნელობა და მოქმედების ნებართვა სხვა ფენებში მოწმდება.
სახელები ყოველთვის სწორად ამოიცნობა?
არა. უცნობი სახელი, ბრუნვა და მსგავსი ჟღერადობა შეცდომის წყაროა. საჭირო ველი უნდა დაზუსტდეს ან სანდო წყაროს შეედაროს.
მიკროფონის დემო სატელეფონო ხარისხს ამტკიცებს?
არა. კოდეკი, 8 kHz აუდიო, ექო და ცუდი კავშირი ცალკე სატესტო პირობებია.
OMO ფლობს ამოცნობის მოდელს?
კომპონენტის გამოყენება ან მასთან ინტეგრაცია საბაზო მოდელის საკუთრებას არ ნიშნავს. კონკრეტული მომწოდებელი და OMO-ს საინჟინრო წვლილი ცალ-ცალკე უნდა შეფასდეს.
STT-ის ცალკე შეძენა შეიძლება?
ეს გვერდი დამოუკიდებელი STT პროდუქტის ან საჯარო API-ს ხელმისაწვდომობას არ აცხადებს. ასეთი მოთხოვნის მოცულობა და პირობები გუნდთან ცალკე უნდა გადამოწმდეს.
პირველწყაროები და საზღვრები
გადამოწმებულია 2026 წლის 17 სექტემბერს. ეს წყაროები განმარტავს ტექნიკურ მექანიზმებს და არა OMO-ს კონკრეტულ დანერგვაში ყველა ფუნქციის ხელმისაწვდომობას. შეთავაზებული კავშირები და მაგალითები ცალკე შეფასებას მოითხოვს.
- Google Cloud — streaming recognition
ნაკადური ტრანსკრიფციის ნაწილობრივი და საბოლოო შედეგები.
- Google Cloud — measuring recognition accuracy
ცნობილ ტექსტთან შედარება და სიტყვების შეცდომის მაჩვენებელი (WER).
- LiveKit — turn detection and interruptions
საუბრის რიგის, აქტივობისა და შეწყვეტის კონტროლის განსხვავებული მექანიზმები.

