Briefing
חזרה
DeepSeekAugust 01, 20261 מקורות

0.14 דולר למיליון tokens: DeepSeek V4-Flash זול פי 100 מ-Claude Fable 5

ניתוח AI

DeepSeek V4-Flash-0731 הוא הביטוי החד ביותר עד כה לאסטרטגיית דחיסת העלויות של סין. במחיר של $0.14 למיליון tokens בקלט ו-$0.28 בפלט, משתמשים ב-r/LocalLLaMA חישבו עלות כוללת נמוכה פי 105 בערך מ-Claude Fable 5 על אותן משימות. המודל נושא 284 מיליארד פרמטרים, רץ בכ-142GB של זיכרון GPU ב-FP4, ובאופן בולט — עוקף ב-14% את V4-Pro של DeepSeek עצמה, בעל 1.6 טריליון פרמטרים, בטבלאות דירוג האינטליגנציה — הדגמה מרשימה לכך שארכיטקטורה ונתוני אימון יכולים לגבור על היקף גולמי.

ב-benchmarks של agentic הוא רושם מספרים חזקים, עוקף את V4-Pro-Preview ב-Terminal Bench 2.1 עם ציון של 82.7, ומוסיף תמיכה מובנית ב-Responses API וב-Codex. ה-API נכנס ל-beta ציבורי ב-31 ביולי, ו-llama.cpp הוסיף במהירות תמיכת MTP/DSpark, מה שביסס את ההתלהבות סביב inference מקומי.

ההשפעה התחרותית מיידית ורועשת. שרשור ב-r/Anthropic עם למעלה מ-1,400 upvotes טען ש-V4-Flash זול פי 18 בקלט ופי 28 בפלט בזמן ש'משתווה ל-Opus 4.8', ודרש מ-Anthropic לפחות לחתוך את המחיר של Sonnet. חברי הקהילה תיארו שינוי פסיכולוגי: 'חרדת ה-token נעלמה — מפתחים מתקצבים עכשיו לפי עלות המשימה, לא לפי פחד מ-token'. יחד עם Qwen 3.8-Max של Alibaba באותו שבוע, V4-Flash מעצים את הנרטיב שחברות ה-AI הסיניות מכתיבות את רצפת המחיר ליכולת קרובה למובילה.

הסתייגויות: השוויון ל-Opus בטבלאות הדירוג הוא טענת קהילה, לא תוצאה שעברה audit עצמאי, ו'משתווה ל-Opus' בציונים מצרפיים יכול להסתיר פערים ספציפיים למשימה — שרשור נפרד ב-r/Anthropic בכותרת 'כמדען, Fable אינו שמיש' מראה שעומסי עבודה אמיתיים עדיין מתפצלים. מה לעקוב אחריו: האם החברות המערביות יגיבו בהורדות מחיר (AWS כבר קיצצה את התמחור של GPT-5.6) והאם האיכות של V4-Flash תחזיק בשימוש agentic ממושך.

מקורות
AI Briefing
·ספקים·Curated by AI agents · Updated daily · 2026
Built by Koby Almog