הנושא חורג מעט מגבולות הדיון הרגילים שלנו, אבל לאור התגובות לגבי
התרגום של גוגל מעברית ולעברית חשבתי שאולי כדאי לתת מעט קישורים לקריאה נוספת בעניין.
באופן כללי התרגום של גוגל מבוסס על מה שמכונה
תרגום מכונה סטטיסטי. הרעיון מאחורי שיטה זו פשוט: בעזרת מודלים סטטיסטיים של שתי השפות מחפשים טקסט שההסתברות שהוא התרגום של הטקסט הנתון היא מקסימאלית. המימוש הוא הרבה יותר מורכב ומתוחכם, כמובן.
גוגל מסבירים בקצרה את הרעיון ב
FAQ של מערכת התרגום שלהם. בזמנו שמעתי הרצאה של מנהל המחקר שלהם שסיפר איך הם פיתחו בכמה ימים את התרגום מערבית - מבלי שאיש בצוות ידע ערבית... יש להניח שהתוצאה לא הייתה מושלמת!
בכדי שהתרגום יהיה מוצלח המודל הסטטיסטי צריך להיות מבוסס על קורפוס גדול ככל האפשר. יש להניח שזו אחת הסיבות לכך שהם מאפשרים היום להציע תיקוני תרגום. גוגל אף פתחו אתר
לשידוך בין מתרגמים ללקוחות,
שייתכן שהוקם למטרות דומות.
למי שרוצה לדעת הרבה יותר: רשימת
הפניות למאמרים, ו
הסבר כללי על הטכינקות של תרגום מכונה סטטיסטי, כולל הפניות למאמרים.
תוויות: גוגל, עיבוד שפה טבעית, תרגום