Claude Opus 5 נחת: 30.2% ב-ARC-AGI-3, בחצי מהעלות של Fable 5

Anthropic מיצבה את Claude Opus 5 כ'מעמיק ויוזם', והבטיחה ביצועים משופרים משמעותית באותה נקודת מחיר של קודמו Opus 4.8 — תוך התקרבות לרמת האינטליגנציה המובילה של Claude Fable 5 בחצי מהמחיר. המספר הבולט הוא ARC-AGI-3: Opus 5 הבקיע 30.2%, לעומת 7.8% של GPT-5.6 Sol (Max) מבית OpenAI — benchmark שתוכנן במפורש למדוד reasoning כללי ולא מיומנויות משוננות. התמחור עומד על 5 דולר למיליון input tokens ו-25 דולר למיליון output tokens, ו-Opus 5 הופך לברירת המחדל ב-Claude Max ולאופציה החזקה ביותר ב-Claude Pro.
Swami Sivasubramanian מ-AWS, שהכריז על הזמינות ב-Bedrock, הדגיש התנהגות של agent ארוך-טווח: Opus 5 'מפעיל agents ארוכי-טווח שעובדים שעות ואפילו לאורך הלילה', מנווט ב-codebases 'כמו מהנדס מנוסה', מתעמת עם הוראות שגויות במקום לבצע אותן בעיוורון, ומייצר sub-agents שדורשים פחות פיקוח.
הפסיקה של המפתחים חלוקה יותר. ב-r/Anthropic, thread שטען כי Opus 5 'מרגיש הרבה יותר כואב מ-4.8' צבר 118 תגובות, ושני ('Opus 5 באמת בוחן את הסבלנות שלי') הגיע ל-183 upvotes — מה שמרמז שהמודל אולי מצפה למוסכמות prompting שונות. Jerry Liu מ-LlamaIndex הריץ עליו benchmark של document parsing (ParseBench) ומצא אותו 'בערך באותה רמה כמו Opus 4.8', מעט גרוע יותר בטבלאות צפופות, ו — ב-8 סנט לעמוד — לא שווה שימוש ל-OCR בקנה מידה גדול לעומת Gemini 3.6 Flash או LlamaParse. הפסיקה שלו: מצוין ל-coding ולעבודת ידע, ערך גרוע ל-document parsing בהיקף.
במקביל, Anthropic התמודדה עם מבוכת פרטיות כשצ'אטים ש-Claude שיתף אינדוקסו כביכול על ידי Google Search. המסגרת התחרותית חדה: יתרון ה-benchmark של Opus 5 על GPT-5.6 Sol מגיע בדיוק כשמודלים סינים פתוחים וזולים צובאים על השוק מלמטה.