דילוג לתוכן
Nivision
Speech-to-Text בעברית

מנוע Speech-to-Text שאומן ספציפית על עברית.

Nivision משתמשת במנוע speech-to-text שאומן על דיבור עברי - לא Whisper גנרי, לא תרגום מאנגלית. דיוק גבוה על שיחות נקיות, ועמידות לאודיו מאתגר.

מה זה Speech-to-Text בעברית

הטכנולוגיה שהופכת אודיו עברי לטקסט נקי - הבסיס של כל ניתוח שיחה.

Speech-to-Text (STT, או 'זיהוי דיבור') היא הטכנולוגיה הבסיסית שהופכת קובץ אודיו לטקסט. STT עברי קשה משמעותית מ-STT אנגלי - עברית היא שפה דחוסה עם מורפולוגיה עשירה, ובאודיו של מוקדים מתערבבים בה ביטויי סלנג, מילים באנגלית, ולעיתים גם ערבית או רוסית. מנוע STT איכותי לעברית חייב להיות מאומן על דיבור עברי טבעי - לא להסתמך על תרגום ממודל אנגלי.

איך זה עובד

ארבעה גורמים שמייצרים STT עברי ברמה תפעולית:

STT עברי איכותי הוא יותר ממודל יחיד. הוא דורש שילוב של אקוסטיקה, לשון, סביבת שיחה ודרישות תפעוליות אמיתיות.

01

מודל אקוסטי + לשוני שאומן על עברית

המנוע מבוסס על שילוב של מודל אקוסטי (איך נשמעת עברית) ומודל לשוני (איך עברית מורכבת תחבירית). שניהם אומנו על דיבור עברי טבעי בנפח גדול.

02

תמיכה במגוון מבטאים ודוברים

ילידיים, עולים, דוברי עברית כשפה שנייה - המודל אומן על מגוון רחב, ומטפל באוכלוסיית הדוברים האמיתית של מוקדים ישראלים.

03

עמידות לרעש רקע ואודיו דחוס

אודיו של שיחות טלפון דחוס משמעותית מהקלטות סטודיו. המנוע מטופל בעיבוד מקדים, ומאומן על אודיו אמיתי כדי להתמודד עם פערי איכות.

04

תמלול מהיר לאחר השיחה, בקנה מידה

Nivision מתמללת בעיבוד שלאחר השיחה: כל שיחה זמינה תוך דקות מסיומה. אפשר לתמלל גם נפחי batch גדולים של הקלטות היסטוריות באותה איכות. תמלול בזמן אמת תוך-שיחה (real-time streaming) נמצא במפת הדרכים.

למי זה מיועד

מי זקוק ל-Speech-to-Text ייעודי לעברית?

STT עברי איכותי הוא תשתית. הוא רלוונטי בכל מקום שבו צריך להפוך אודיו עברי לטקסט שאפשר לפעול עליו - לא רק לתעד.

  • מוקדים שמתמללים שיחות לצורך ניתוח או QA
  • ארגוני ביטוח ופיננסים שמחויבים לתיעוד לצורך רגולציה
  • צוותי מוצר שמנתחים שיחות לקוח לזיהוי בעיות
  • צוותי AI שצריכים שכבת STT מדויקת בשפה ובדומיין שלהם
  • מערכות פנימיות שצריכות תמלול אוטומטי של שיחות עברית
השוואה

שלוש קטגוריות של מנועי STT עבריים - מי מתאים למוקדים?

מי שמחפש STT לעברית פוגש שלוש קטגוריות כלים, וההתאמה תלויה בדיוק הנדרש, בנפח, ובסביבה התפעולית.

ההשוואה הבאה היא ברמת קטגוריה, לא ברמת מוצר ספציפי.

קטגוריית מנוע STTדיוק על שיחות מוקד בעבריתהפרדת דובריםטיפול באודיו של טלפוניהאינטגרציה תפעוליתתמיכה מקומיתהתאמה מומלצת
מודלים גנריים open-source (Whisper-class)בינוני, תלוי בגרסהלא מובנהמוגבלדורש פיתוח עצמיקהילהפרויקטי R&D ופיתוח עצמי
שירותי STT ענן בינלאומייםטוב על אודיו נקי, יורד על אודיו של מוקדיםתוסףמוגבלAPI בלבדכללית, לא מקומיתפרויקטים שזקוקים ל-API לזיהוי דיבור גנרי
STT ייעודי למוקדים בעברית (כמו Nivision)גבוה, בנוי לאודיו מוקדמובנהכןפלטפורמה שלמהישראלית, ייעודית למוקדיםמוקדים שצריכים פתרון תפעולי מלא
מה מקבלים בפועל

התוצאה

  • תמלילים מדויקים שמיועדים גם לבני אדם וגם ל-AI
  • הפרדת דוברים אוטומטית בלי קונפיגורציה
  • תמלילים זמינים תוך דקות מסיום השיחה - להתראות ולדשבורד שמתעדכן כל הזמן
  • תמלול batch לארכיון שיחות היסטורי
  • תשתית STT שלא צריך לתחזק ולעדכן עצמאית
  • מנוע שמשתפר עם הזמן על דומיין השיחות שלכם
Speech-to-Text בעברית

שאלות נפוצות

במה מנוע STT ייעודי לעברית טוב יותר ממודל גנרי כמו Whisper?

מודלים גנריים מאומנים בעיקר על אנגלית, ועברית משולבת בהם כשפה משנית. מנוע STT שאומן ייעודית על עברית הולך לעומק - מודל אקוסטי שמכיר את הצלילים של עברית מדוברת, מודל לשוני שמבין את התחביר העברי, וטיפול ייעודי באודיו של מוקדים. התוצאה: דיוק גבוה יותר על שיחות אמיתיות, במיוחד כאלה שכוללות סלנג ישראלי.

מה הדיוק שלכם על אודיו של טלפוניה (קצב דגימה נמוך)?

אודיו של שיחות טלפון בדרך כלל ב-8kHz, נמוך משמעותית מהקלטות סטודיו. המנוע שלנו אומן ספציפית על אודיו טלפוני, ולכן הדיוק נשאר גבוה גם בקצב דגימה נמוך - בניגוד למודלים שאומנו רק על אודיו באיכות גבוהה.

המערכת מספקת timestamps לכל מילה?

כן. כל תמליל מגיע עם timestamps ברמת מילה - שימושי לחיפוש מדויק בתוך השיחה, סנכרון להשמעה של נקודות ספציפיות, וניתוח קצב הדיבור של הנציג והלקוח.

ה-STT שלכם זמין כ-API נפרד?

Nivision נמכרת כפלטפורמה שלמה - תמלול הוא רכיב אחד מתוכה. אם נדרשת רק שכבת STT נפרדת, שווה לדבר איתנו ולתאר את התרחיש כדי שנציע את הפתרון הנכון.

תוך כמה זמן תמליל זמין אחרי סיום השיחה?

Nivision מתמללת בעיבוד שלאחר השיחה: התמליל זמין תוך דקות מסיום השיחה. תמלול בסטרימינג בזמן אמת תוך-שיחה (sub-second latency) נמצא במפת הדרכים; ברוב מקרי השימוש במוקדים, התמלול שלאחר השיחה מספיק להתראות, דשבורד, סיכומים וסנכרון ל-CRM.

מה לגבי קולות חופפים או שיחות עם יותר משני דוברים?

המערכת תומכת בהפרדת דוברים גם בשיחות עם 3-4 משתתפים (למשל: שיחת מכירה עם 2 נציגים ולקוח). דיוק ההפרדה יורד מעט בקולות מאוד דומים או בדיבור חופף משמעותי, אבל נשאר ברמה שמאפשרת ניתוח מעשי.

המודל לומד את המונחים הייחודיים של החברה שלי?

כן. אפשר להעלות מילון מונחים ייעודי (שמות מוצרים, ראשי תיבות, מונחים מקצועיים) שמשפר את הדיוק על ביטויים שלא נפוצים בעברית הכללית. המערכת גם לומדת בהדרגה מהשיחות שלכם.

מה לגבי אבטחת מידע על האודיו והתמלולים?

כל האודיו והתמלילים מוצפנים באחסון ובמעבר, ואפשר להגדיר מדיניות שמירת מידע. Nivision תומכת בדרישות אבטחת מידע ורגולציה של תעשיות מפוקחות בישראל. פרטים מלאים בעמוד /security.

מתחילים

הפכו את השיחות שלכם לפעולה.

ראו את Nivision מנתחת שיחות כמו אלה שהצוות שלכם מנהל כל יום. הדגמה של 30 דקות, בלי מצגות.

דברו איתנו