''
נקודה
תל אביב
שמיים בהירים
28°
ירושלים 25°
חיפה 27°
באר שבע 27°
אילת 35°
מדורים
שימושי PLUS

כשהנהג מדבר והמכונית שומעת...

מעבדות IBM בחיפה פתרו בעייה לדוברי מנדרין קנטונזית

עמוס באר
י"ח טבת התשס"ד
t
t

מדענים במעבדת המחקר של יבמ בחיפה השלימו עבודה מקיפה שתאפשר לסייע בזיהוי דיבור בעזרת מכשירים ניידים.

זיהוי דיבור מבוזר מאפשר להקנות למכשירים ניידים בעלי עוצמת מחשוב נמוכה, יכולות זיהוי דיבור ברמת הדיוק שהתאפשר עד כה רק בסביבת מחשוב בעוצמה גבוהה יותר. המערכת המבוזרת מפצלת את תהליך הזיהוי בין המכשיר הנייד - ובין שרתים הפועלים ברשת. זאת במקום לשלוח את נתוני הדיבור אל השרת, וביצוע כל העיבוד הרחק ממכשיר הקצה, או לחלופין ביצוע כל תהליך הזהוי במכשיר הנייד.

התחלת העיבוד על גבי המכשיר הנייד מאפשרת למכשיר הזה לגזור נתונים ומאפיינים של הדיבור, לדחוס אותם תוך הפעלת מנגנון הגנה משגיאות תקשורת, ולשדר אותם באופן היעיל ביותר אל השרת. לאחר שהמידע הדחוס הגיע לשרת, יכולה המערכת להמיר את רצף המידע המתקבל אליה - לטקסט. טקסט כזה יכול להיות פקודות והוראות ביצוע למערכת ממוחשבת, או אפילו טקסט חופשי אותו ניתן לשגר כפקס, למשל.

הפיתוח במעבדות יבמ בחיפה התמקד בתוספת פונקציות לבנייה מחדש של דיבור, וזיהוי הטון והשפה, המכונים ככל הנראה "שפה טונאלית".

טכנולוגיית זיהוי דיבור מבוזר צוברת תאוצה בתעשיית התקשורת, עם זמינותם של יותר ויותר שירותים מבוססי דיבור אליהם ניתן לגשת ממכשירים סלולאריים. דוגמה טובה היא תעשיית הרכב ועולם התחבורה והתיירות, שבה יכול הדיבור לשפר משמעותית שירותים דוגמת מערכות ניווט, שליטה קולית על מערכות ברכב, וגישה של הנהג למקורות מידע בתחומים שונים.

איכות הזיהוי המשופרת מאפשרת שימוש בשירותים מופעלי קול על-ידי קהל גדול של צרכנים. ביזור ההפעלה מאפשר שימוש בטכנולוגיה גם על ידי מכשירים פשוטים וזולים.

מכוניות מציעות סביבה אידיאלית לשירותים המופעלים בפקודות קוליות, כאשר דיבור בטלפון נייד מהווה למעשה את האופציה היחידה לתקשורת דו-כיוונית בטוחה, בין הנהג לבין שאר העולם. זיהוי דיבור מבוזר מציע גישה חדשה להתמודדות עם הסביבה הרועשת של המכונית - מבלי להתפשר ולוותר על דיוק הזיהוי.

העבודה במעבדות יבמ בחיפה מאפשרת לשרת לבנות מחדש את הקול הדחוס שהועבר אליו - על מנת להשמיעו שוב לאוזן אנושית. מדעני יבמ בנו כלים המאפשרים זיהוי והגדרה של סוג הקול ושל אופי הטון כבר ברמת מכשיר הקצה, לצורך שידור המידע הזה אל השרת. המידע הזה יכול לשמש גם לשיפור איכות זיהוי הדיבור עצמו. היכולת לשחזר ולבנות מחדש את הקול חשובה במיוחד במערכות המציעות שירותים על גבי תשתיות מענה קולי וזיהוי דיבור ממוחשב, דוגמת ביצוע פעולות כספיות. עם זמינות היכולת הזאת, מתרחבת יכולתם של המפתחים לשפר ולהתאים את הדקדוק ואת אופן הדו-שיח של המערכות השונות עם לקוחות הקצה.

העבודה המשותפת שהתבצעה במעבדות יבמ בחיפה במעבדות מוטורולה הובילו לקבלת שני תקנים חדשים שירחיבו את מסגרת המפרטים שאושרו על ידי מכון התקנים האירופי. התקנים משפרים את כושר גזירת המידע ברמת מכשיר הקצה - ומאפשרים תוספת פונקציות ויכולות חדשות. כתוצאה, ניתן להוסיף לתקשורת בין מכשיר הקצה ובין השרת 800 סיביות מידע לשניה המספקות מידע על גובה הצליל (pitch) וסוג הקול (voicing), יחד עם 4,800 הסיביות לשנייה, ששודרו עד עתה.

זוהר סיון, מנהל קבוצת מערכות הטלקום והמדיה במעבדות יבמ בחיפה, מסר כי התקן החדש פותח את הדלת להצגת שירותי זיהוי דיבור ללקוחות ניידים - ומשתלב היטב בחתירה הכוללת של יבמ לתקנים פתוחים.

בשפות המאופיינות בטונאליות גבוהה, דוגמת מנדרין, קנטונזית, או תאילנדית, מספקות הפונקציות שפותחו ביבמ מידע חשוב החיוני להבטחת זיהוי דיבור מלא. כך, למשל, זיהוי דיבור במנדרינית מחייב זמינות מידע פונטי מלא - יחד עם מידע טונאלי. מעבדות יבמ בחיפה עבדו בשיתוף פעולה הדוק עם מעבדת המחקר של יבמ בסין, על מנת לבחון את מערכת הקצה החדשה לזיהוי דיבור מבוזר בשפות טונאליות. ביבמ צופים כי שיתוף הפעולה הזה יתרום משמעותית לשימוש המעשי בתקן המשופר החדש.

תגובות

רגע, שקט פה מדי

דעתך חשובה - תהיו הראשונים להגיב על הכתבה