DeepSeek מציתה מלחמת מחירים: V4-Flash-0731 מנצח את V4-Pro ב-0.14 דולר למיליון token

DeepSeek שיגרה רשמית את V4-Flash-0731, החבר החדש ביותר במשפחת ה-V4 של המודלים הפתוחים שלה, ששומרת על ארכיטקטורת Mixture-of-Experts של 284B סה"כ / 13B פעילים אך מספקת רווחים agentic גדולים דרך post-training במקום מודל בסיס גדול יותר. היא קיבלה 82.7% ב-Terminal-Bench 2.1 (עלייה מ-61.8% ב-preview), עקפה את ה-72.1% של V4-Pro-Preview הגדול יותר, והגיעה לשוויון עם Gemini 3.6 Flash. התמחור אגרסיבי: 0.14 דולר למיליון input tokens ו-0.28 דולר למיליון output, עם חלון context של 1M tokens ותאימות Codex. משפחת ה-V4 כוללת גם את V4-Pro ל-reasoning מתקדם.
המנגנון המרכזי הוא הכלכלה. מפתחים ציינו יעילות עלות נמוכה בערך פי 105-137 מ-Claude, קריאות cache-hit ב-0.0028 דולר למיליון, ותיארו 'כלכלה disruptive באמת' למוצרים agentic — בערך פי 3 זול יותר מ-V4-Pro ופי 21 זול יותר מ-Claude Sonnet 5. את המודל אפשר להוריד ולהריץ מקומית, ו-Victor Mustar מ-Hugging Face deploy נקודת inference ציבורית וחינמית תוך שעות מהשחרור.
מבחינה תחרותית, זו התנועה החדה ביותר עד כה במלחמת מחירי ה-inference והפעילה לחץ ישיר על השחקנים הוותיקים: OpenAI חתכה מחירים על המודלים בדרג הנמוך והבינוני שלה באותו שבוע, ו-r/Anthropic ב-Reddit ניהל thread עם 1,406 upvotes שדרש מ-Anthropic לחתוך את תמחור Sonnet. חובבי Local-LLM ב-r/LocalLLaMA (1,378 upvotes) התפעלו שמודל 300B רץ זול יותר מאחד של 9B, ושמודלים שניתן להריץ מקומית כבר משתווים למודל המוביל המוביל ממרץ 2026.
עמדות ספקניות: מפתחים תהו לגבי הקיבולת בעולם האמיתי והאם רווחי ה-benchmark מחזיקים על codebases גדולים בproduction ולא על משימות צעצוע — threads ב-r/DeepSeek ביקשו במפורש 'משוב כן, לא hype'. מה לעקוב: האם DeepSeek תוכל לספק את הביקוש במחירים האלה, והאם חברות ה-AI המערביות יגיבו בהורדות מחיר מבניות ולא בהנחות חד-פעמיות.