מה זה מחשבון טוקנים לבינה מלאכותית?
מחשבון טוקנים לבינה מלאכותית הוא כלי שמאפשר לאמוד את מספר הטוקנים בטקסט נתון ולחשב את עלות עיבוד הטקסט דרך ממשקי API של מודלי שפה גדולים (LLMs) כמו GPT, Claude, Gemini, Grok, DeepSeek, Mistral ו-Llama. טוקנים הם יחידות הטקסט הבסיסיות שמודלי בינה מלאכותית משתמשים בהן כדי לקרוא וליצור טקסט — טוקן יכול להיות מילה שלמה, חלק ממילה, או אפילו תו בודד.
למפתחים ולסטארטאפים ישראליים שבונים אפליקציות מבוססות בינה מלאכותית, הבנת עלויות הטוקנים היא קריטית לתקצוב ולשליטה בהוצאות. כל קריאת API למודל שפה מתומחרת לפי מספר טוקני הקלט (הפרומפט שלכם) וטוקני הפלט (התשובה של המודל). קריאה בודדת עשויה לעלות שברירי אגורה, אבל בקנה מידה של אלפי או מיליוני בקשות ביום — עלויות הטוקנים הופכות לסעיף תקציבי משמעותי.
כלל האצבע הוא שטוקן אחד שווה בערך 4 תווים באנגלית, או כ-0.75 מילה. כלומר, 1,000 מילים באנגלית מתורגמות לכ-1,333 טוקנים. אבל בעברית המצב שונה: טקסט בעברית צורך 50-100% יותר טוקנים מאנגלית עבור אותו תוכן, מכיוון שמערכות הטוקנייזר (tiktoken של OpenAI, SentencePiece של Google) אופטימיזירות בעיקר לאנגלית. המשמעות: עיבוד טקסט עברי דרך API יקר יותר באופן משמעותי.
איך לחשב עלות טוקנים ב-API של בינה מלאכותית
כדי לחשב את עלות קריאת API למודל בינה מלאכותית, צריך שלושה נתונים: מספר טוקני הקלט, מספר טוקני הפלט, ותמחור הטוקנים למודל שבחרתם.
תהליך החישוב שלב אחר שלב:
1. הערכת טוקני הקלט: הדביקו את טקסט הפרומפט בכלי ספירת טוקנים, או השתמשו בקירוב של טוקן אחד ל-4 תווים באנגלית. בעברית, הכפילו את התוצאה ב-1.5 עד 2 כדי לקבל הערכה מדויקת יותר.
2. הערכת טוקני הפלט: זהו האורך הצפוי של תשובת המודל. תשובה קצרה דורשת 100-300 טוקנים; הסבר מפורט עשוי להגיע ל-1,000-2,000 טוקנים.
3. בדיקת תמחור המודל: ספקי AI מפרסמים מחירים בדולרים למיליון טוקנים, עם מחירים נפרדים לקלט ולפלט.
4. הפעלת נוסחת העלות (ראו למטה).
לדוגמה, אם אתם שולחים פרומפט של 2,000 טוקנים ל-Claude Sonnet 4.6 (3$ למיליון טוקני קלט) ומקבלים תשובה של 500 טוקנים (15$ למיליון טוקני פלט), העלות היא: (2,000 / 1,000,000 × $3) + (500 / 1,000,000 × $15) = $0.006 + $0.0075 = $0.0135 לבקשה — כ-0.05 ₪. ב-10,000 בקשות ביום, זה מסתכם ב-135$ ליום, כ-1,500 ₪, או כ-4,050$ (כ-15,200 ₪) לחודש.
טוקני פלט יקרים ב-3 עד 5 פעמים מטוקני קלט, מכיוון שייצור כל טוקן פלט דורש מעבר חישובי נפרד דרך המודל, בעוד שכל טוקני הקלט מעובדים במקביל במעבר אחד.
דוגמאות לחישוב עלות טוקנים
צ’אטבוט שירות לקוחות לחנות אונליין ישראלית
חנות מקוונת ישראלית רוצה להוסיף צ’אטבוט חכם מבוסס GPT-5.4 Nano (0.20$ למיליון טוקני קלט, 1.25$ למיליון טוקני פלט). החנות מטפלת ב-800 פניות לקוחות ביום, כל שיחה כוללת בממוצע 900 טוקני קלט (הוראות מערכת + שאלת הלקוח + היסטוריית שיחה) ו-400 טוקני פלט (תשובת הבוט).
עלות קלט יומית: 800 × 900 / 1,000,000 × $0.20 = $0.144
עלות פלט יומית: 800 × 400 / 1,000,000 × $1.25 = $0.40
עלות יומית כוללת: $0.544 | עלות חודשית: $16.32 (כ-61 ₪)
באמצעות Prompt Caching להוראות המערכת (300 טוקנים קבועים, מחויבים ב-10% ממחיר הקלט), עלות הקלט יורדת בכ-30%. עם מודל יקר יותר כמו Claude Sonnet 4.6 ($3/$15 למיליון), אותו עומס יעלה כ-209$ (כ-785 ₪) לחודש — יקר כמעט פי 13. בחירת המודל הנכון היא המנוף הגדול ביותר לחיסכון.
אפליקציית סיכום תוכן בעברית באמצעות Gemini
סטארטאפ ישראלי בתחום המדיה מסכם 500 כתבות חדשותיות ביום. כתבה ממוצעת בעברית (700 מילים) צורכת כ-1,600 טוקנים — הרבה יותר מכתבה באנגלית באותו אורך (כ-1,000 טוקנים), בגלל יעילות הטוקנייזר הנמוכה בעברית. הסיכום הנדרש: כ-200 מילים = כ-500 טוקנים. הם משתמשים ב-Gemini 2.5 Flash (0.30$ למיליון קלט, 2.50$ למיליון פלט).
עלות קלט יומית: 500 × 1,600 / 1,000,000 × $0.30 = $0.24
עלות פלט יומית: 500 × 500 / 1,000,000 × $2.50 = $0.625
עלות יומית: $0.865 | עלות חודשית: $25.95 (כ-97 ₪)
אם היו עוברים ל-Claude Opus 4.8 ($5/$25 למיליון) לסיכומים באיכות גבוהה יותר, העלות החודשית הייתה קופצת ל-307$ (כ-1,150 ₪) — עלייה של פי 12. הרצת פיילוט על 50 כתבות בשני המודלים לפני החלטה היא גישה חכמה.
עוזר קוד לצוות פיתוח של 15 מפתחים
חברת תוכנה ישראלית עם 15 מפתחים משתמשת בעוזר קוד מבוסס Claude Sonnet 4.6 (3$ למיליון קלט, 15$ למיליון פלט). כל מפתח שולח כ-35 בקשות ביום, עם ממוצע של 2,000 טוקני קלט (קונטקסט קוד + שאלה) ו-700 טוקני פלט (הצעות קוד + הסבר).
בקשות יומיות: 15 × 35 = 525
עלות קלט יומית: 525 × 2,000 / 1,000,000 × $3.00 = $3.15
עלות פלט יומית: 525 × 700 / 1,000,000 × $15.00 = $5.51
עלות יומית: $8.66 | עלות חודשית (22 ימי עבודה): $190.52 (כ-715 ₪)
זה יוצא כ-48 ₪ למפתח בחודש — פחות מעלות של ארוחת צהריים. ביחס לשיפור הפרודוקטיביות שעוזר קוד חכם מאפשר, מדובר בהחזר השקעה מצוין. שימוש ב-Prompt Caching לקונטקסט הקוד המשותף יכול לחסוך עוד 15-25%.
שאלות נפוצות על טוקנים ותמחור בינה מלאכותית
כמה טוקנים יש ב-1,000 מילים בעברית?
בממוצע, 1,000 מילים בעברית צורכות כ-2,000-2,500 טוקנים במודלים כמו GPT ו-Claude. לשם השוואה, 1,000 מילים באנגלית מתורגמות לכ-1,333 טוקנים. ההפרש נובע מכך שמערכות הטוקנייזר (כמו tiktoken) מותאמות בעיקר לאנגלית ולשפות לטיניות, בעוד שעברית כשפה שמית עם מורפולוגיה עשירה (אותיות ניקוד, מילות יחס מחוברות, שורשים) דורשת פירוק לחתיכות קטנות יותר. המשמעות המעשית: עיבוד טקסט עברי עולה 50-100% יותר מאנגלית.
למה טוקני פלט יקרים יותר מטוקני קלט?
טוקני פלט יקרים פי 3-5 מטוקני קלט בגלל ההבדל בתהליך החישובי. טוקני קלט מעובדים במעבר אחד במקביל דרך המודל. לעומת זאת, טוקני פלט חייבים להיווצר אחד-אחד ברצף — כל טוקן חדש דורש מעבר חישובי נפרד. תהליך סדרתי זה יקר הרבה יותר מבחינת חישוב וזיכרון. לדוגמה, Claude Sonnet 4.6 גובה 3$ למיליון טוקני קלט אבל 15$ למיליון טוקני פלט — יחס של 1:5.
מה המודל הכי זול ל-API של בינה מלאכותית ב-2026?
נכון ליוני 2026, המודלים הזולים ביותר (קלט/פלט למיליון טוקנים): Amazon Nova Micro ($0.035/$0.14), Cohere Command R7B ($0.0375/$0.15), Gemini 2.5 Flash-Lite ($0.10/$0.40), DeepSeek V4 Flash ($0.14/$0.28) ו-Mistral Small 4 ($0.15/$0.60), ו-GPT-5.4 Nano ($0.20/$1.25). בטווח הביניים בולטים Gemini 3.1 Flash-Lite ($0.25/$1.50), DeepSeek V4 Pro ($0.435/$0.87), GPT-5.4 Mini ($0.75/$4.50), Claude Haiku 4.5 ($1/$5) ו-Grok 4.3 ($1.25/$2.50). בשקלים, מודל כמו Gemini 2.5 Flash-Lite עולה כ-0.38 ₪ למיליון טוקני קלט — אגורות בודדות למאות קריאות קצרות. לפני שבוחרים מודל זול, חשוב לבדוק את האיכות בעברית — לא כל המודלים הזולים מתמודדים טוב עם עברית; למשימות מורכבות שקלו מודלים מתקדמים כמו GPT-5.4 ($2.50/$15), Claude Sonnet 4.6 ($3/$15), Claude Opus 4.8 ($5/$25), GPT-5.5 ($5/$30) או Claude Fable 5 ($10/$50).
מה ההבדל בין טוקנים למילים?
מילה היא יחידת שפה שמופרדת ברווחים. טוקן הוא יחידה שמוגדרת על ידי הטוקנייזר של המודל — הוא יכול להיות מילה שלמה, חלק ממילה, תו בודד או סימן פיסוק. מילים נפוצות כמו 'the' או 'is' הן בדרך כלל טוקן אחד. מילים ארוכות או נדירות מפוצלות למספר טוקנים: למשל, 'unbelievable' הופכת ל-'un', 'believ', 'able' (3 טוקנים). בעברית, מילה כמו 'שהשתמשתי' עשויה להתפצל ל-4-5 טוקנים. קוד, מספרים וטקסט שאינו באנגלית בדרך כלל דורשים יותר טוקנים למילה.
איך Prompt Caching מפחית עלויות?
Prompt Caching שומר את וקטורי ה-key-value של פרומפטים חוזרים (כמו הוראות מערכת) כך שאין צורך לחשב אותם מחדש בכל בקשה. טוקנים שמורים מחויבים בכ-10-25% מהמחיר הרגיל, תלוי בספק — משפחת GPT-5.4/5.5 של OpenAI ומודלי Claude של Anthropic מחייבים פגיעות מטמון ב-10% ממחיר הקלט. לאפליקציות ששולחות את אותן הוראות מערכת בכל בקשה — צ’אטבוטים, עוזרי קוד, מעבדי מסמכים — Prompt Caching יכול להפחית עלויות קלט עד 90%. ב-OpenAI זה פועל אוטומטית; ב-Anthropic וב-Google נדרשת הגדרה מפורשת.
כמה עולה לעבד מסמך של 10,000 מילים בעברית?
מסמך של 10,000 מילים בעברית הוא כ-20,000-25,000 טוקני קלט (בהשוואה ל-13,333 טוקנים לאותו אורך באנגלית). עם GPT-5.4 (2.50$ למיליון טוקני קלט), עלות הקלט בלבד היא כ-$0.05-$0.06 (כ-0.19-0.23 ₪). אם המודל מייצר סיכום של 500 מילים (כ-1,200 טוקנים ב-15$ למיליון), עלות הפלט היא כ-$0.018 (כ-0.07 ₪). סך הכול לעיבוד מסמך אחד: כ-0.28 ₪. עיבוד 1,000 מסמכים כאלה: כ-280 ₪ (כ-75$). עם GPT-5.4 Mini, העלות נמוכה ביותר מפי 3.
האם כדאי להשתמש ב-API או במנוי ChatGPT Plus?
זה תלוי בסוג השימוש. מנוי ChatGPT Plus עולה 20$ לחודש (כ-75 ₪) ומספק שימוש נדיב אך מוגבל במודלים העדכניים כמו GPT-5.5. API, לעומת זאת, מתומחר לפי צריכה בפועל. אם אתם צורכים פחות מ-7,500 בקשות בחודש (עם ממוצע 500 טוקנים לבקשה), ה-API זול יותר. אבל המנוי עדיף למשתמש בודד שצריך ממשק שיחה. לאפליקציות ומוצרים תוכנתיים, ה-API הוא האפשרות היחידה.
האם תמונות וקבצים צורכים טוקנים במודלים רב-מודליים?
כן. כשמשתמשים במודלים שתומכים בראייה ממוחשבת כמו GPT-5.4, Claude או Gemini, תמונות מומרות לטוקנים לפי הרזולוציה שלהן. תמונה סטנדרטית של 1024×1024 פיקסלים צורכת בסדר גודל של 1,000-1,500 טוקנים, תלוי בספק — Anthropic מתעדת את הקירוב רוחב × גובה / 750, שמניב כ-1,400 טוקנים לתמונה כזו. תמונות ברזולוציה גבוהה יותר צורכות יותר טוקנים, ומצב 'high detail' אצל ספקים שמציעים אותו יקר משמעותית ממצב 'low detail'. מסמכי PDF וקבצים אחרים בדרך כלל מומרים לטקסט תחילה ואז מטוקנזים כרגיל.
כמה עולה GPT-5.6 Sol למיליון טוקנים?
GPT-5.6 Sol עולה $5 למיליון טוקני קלט ו-$30 למיליון טוקני פלט. Terra נמצא ב-$2/$12 ו-Luna ב-$0.20/$1.20. עבור צ'אטבוט עם 2,000 טוקני קלט ו-500 טוקני פלט, ב-100 בקשות ביום, מדובר ב-$75.00 לחודש עם Sol, $30.00 עם Terra ו-$3.00 עם Luna — הפער בין הרמה הזולה לגבוהה הוא בדיוק פי 25.
כמה עולה Claude Opus 5 והאם הוא זול יותר מ-GPT-5.6 Sol?
Claude Opus 5 עולה 5 דולר למיליון טוקני קלט ו-25 דולר לפלט; Claude Sonnet 5 נמצא ב- $3/$15 דולר. Opus 5 מחייב על הקלט אותו מחיר כמו GPT-5.6 Sol אך על הפלט פחות, ולכן התשובה תלויה ביחס שלכם: באותו צ'אטבוט 2,000/500 ב-100 בקשות ביום, Opus 5 מגיע ל-67.50 דולר לחודש מול 75.00 של Sol, ובעומסים שנשלטים על ידי הקלט השניים נבדלים בפחות מסנט אחד לבקשה.
מודל חדש באותו מחיר — האם הוא באמת עולה אותו דבר?
לא בהכרח. מודלים מ-Claude 4.7 ואילך (Opus 5, Opus 4.8, Sonnet 5) משתמשים בטוקנייזר חדש שמפרק את אותו טקסט לכ-30% יותר טוקנים מ-Sonnet 4.6 וקודמיו. Sonnet 5 ו-Sonnet 4.6 מתומחרים שניהם ב-3/15 דולר, אך עומס שעלה 40.50 דולר לחודש ב-Sonnet 4.6 יעלה כ-52.65 דולר ב-Sonnet 5. המעבר מ-Opus 4.8 ל-Opus 5 ניטרלי, שכן שניהם כבר משתמשים בטוקנייזר החדש.
מילון מונחים
טוקן (Token)
היחידה הקטנה ביותר של טקסט שמודל שפה גדול מעבד. טוקן יכול להיות מילה, חלק ממילה, תו או סימן פיסוק. רוב המילים באנגלית הן 1-2 טוקנים; בעברית מילה אחת היא 2-3 טוקנים.
טוקנייזר (Tokenizer)
האלגוריתם שממיר טקסט גולמי לטוקנים. מודלים שונים משתמשים בטוקנייזרים שונים (tiktoken ב-OpenAI, SentencePiece ב-Google), כך שאותו טקסט יכול להפיק ספירות טוקנים שונות בין ספקים.
BPE (Byte Pair Encoding)
אלגוריתם הטוקניזציה הנפוץ ביותר במודלי שפה מודרניים. הוא בונה אוצר מילים על ידי מיזוג חוזר של זוגות התווים או תת-המילים השכיחים ביותר. GPT, Claude ו-Llama כולם משתמשים בגרסאות של BPE.
חלון הקשר (Context Window)
המספר המקסימלי של טוקנים שמודל יכול לעבד בבקשה אחת, כולל קלט ופלט. חלונות הקשר נעים בין 128K ליותר מ-1M טוקנים — Claude Fable 5, Claude Opus 4.8 ו-Claude Sonnet 4.6 כוללים חלון של 1M טוקנים בתמחור הרגיל, Grok 4.3 ו-DeepSeek V4 תומכים ב-1M, ו-Gemini 2.5 Pro עד 1M טוקנים.
Prompt Caching (שמירת פרומפטים במטמון)
תכונת אופטימיזציה שמאחסנת ומשתמשת מחדש בחישובי key-value של פרומפטים חוזרים, ומפחיתה עלויות טוקנים עד 90% על החלק השמור. זמינה ב-OpenAI, Anthropic ו-Google.
טוקני קלט מול טוקני פלט
טוקני קלט הם הטוקנים בפרומפט שנשלח למודל. טוקני פלט הם הטוקנים שנוצרים בתשובת המודל. טוקני פלט יקרים פי 3-5 בגלל החישוב הסדרתי הנדרש ליצירת כל טוקן.
עלות למיליון טוקנים (Cost per Million Tokens)
יחידת התמחור הסטנדרטית של ממשקי API למודלי בינה מלאכותית. ספקים מציינים מחירים בדולרים למיליון טוקנים, בנפרד לקלט ולפלט.