אם ניסית פעם להעביר הקלטה של פגישה בעברית דרך כלי תמלול אקראי, כנראה קיבלת משהו שנע בין מצחיק למתסכל: מילים שהומרו לאחרות, מונחים מקצועיים שאבדו, ודוברים שהתמזגו לאדם אחד מבולבל. ואז אולי חשבת שהכלי גרוע. האמת מורכבת יותר: עברית פשוט קשה למכונה, הרבה יותר מאנגלית, ומסיבות מבניות אמיתיות.

הבנת הסיבות האלה חשובה, כי היא מסבירה למה אי אפשר סתם לקחת כלי שמבריק באנגלית ולצפות שיעבוד בעברית, ומה כן צריך לחפש בפתרון עברי אמיתי. במאמר הזה נפרק מה מקשה על תמלול עברי, ומה עושה אותו טוב.

למה עברית קשה למכונה

כמה מאפיינים של עברית, כל אחד לבד מאתגר, וביחד קשים באמת:

  • ערבוב לועזית: עברית עסקית מדוברת שזורה באנגלית. ״עשיתי sync על ה-deadline״ הוא משפט תקין לחלוטין, ומכונה שמצפה לשפה אחת נכשלת בו.
  • עושר צורות: עברית מלאה בהטיות, זכר ונקבה, יחיד ורבים, גופים, שמצריכות מהמכונה להבחין בין צורות דומות שנשמעות כמעט זהות.
  • ריבוי דוברים וחפיפות: שיחה עברית טבעית מהירה, אנשים נכנסים זה לזה בדברים, וזיהוי מי אמר מה נעשה קשה.
  • פחות נתונים: כמות חומר האימון הזמין בעברית קטנה בהרבה מאנגלית, אז המודלים פשוט ראו פחות עברית, וזה ניכר בדיוק.

למה מודל חזק יותר לא מספיק

הפיתוי הוא לחשוב שהפתרון הוא פשוט ״מודל גדול יותר״. אבל כמו בבעיות עברית אחרות, רוב השיפור לא מגיע ממודל חכם יותר אלא מהנדסה סביב הבעיה: התאמה מפורשת לעברית מדוברת, טיפול בלועזית באמצע משפט, ושימוש בהקשר העסקי כדי לנחש נכון כשהצליל מעורפל. זה בדיוק אותו לקח שלמדנו בזיהוי תווים בעברית, שעליו כתבנו בנפרד: ההנדסה סביב המודל היא שעושה את ההבדל.

הטעות היא להניח שמה שעובד מצוין באנגלית יעבוד בעברית. עברית היא לא אנגלית עם אותיות אחרות, היא שפה עם אתגרים משלה, ותמלול שמכבד אותם מדייק, ותמלול שמתעלם מהם מנחש.

למה הדיוק הזה קריטי

תמלול הוא לא מטרה בפני עצמו, הוא בסיס. הסיכום, ההחלטות והמשימות שמופקים מהפגישה נבנים כולם על התמלול. אם מונח מרכזי הומר בטעות, או משפט יוחס לדובר הלא נכון, כל מה שנבנה מעליו יהיה שגוי, ובביטחון מלא. תמלול שגוי לא סתם מפספס, הוא מייצר טעויות שנראות אמינות, וזה מסוכן יותר. לכן איכות התמלול קובעת את איכות כל מה שבא אחריו, כולל סיכום הפגישה האוטומטי.

איך זה עובד ב-HELIX

HELIX Meeting בנוי לעברית מראש, לא כאופציה שנתלתה על מנוע אנגלי. הוא מטפל בערבוב לועזית, מזהה דוברים בשיחה עברית טבעית, ומשתמש בהקשר של הפגישה כדי לדייק במונחים. התוצאה היא תמלול שאפשר לסמוך עליו, ולכן גם סיכום והחלטות שאפשר לסמוך עליהם, כי הם יושבים על בסיס נכון.

השורה התחתונה: תמלול בעברית קשה, ולא כי הכלים עצלנים אלא כי לעברית יש אתגרים אמיתיים שאנגלית לא מציבה. אל תניח שכלי שמבריק באנגלית יעבוד לך, תבחר פתרון שבנוי לעברית ומתמודד עם הלועזית, הצורות והדוברים. כי סיכום פגישה חכם על תמלול שגוי הוא פשוט שגיאה מנוסחת יפה.

מקורות

  1. Harvard Business Review, Stop the Meeting Madness
  2. MDPI / academic overview, Automatic Speech Recognition challenges
  3. Steven Rogelberg, The Science of Meetings