الوكيل يقول إنه أنجز — تأكّد
الأسبوع لم يأتِ بنموذج أقوى، بل بدرس واحد مكرّر: ما يقوله الوكيل عن نفسه ليس دليلًا. OpenAI نشرت براهين تُفحَص آليًا لا تُصدَّق، وورقة رفعت نجاح الوكلاء من 51.8% إلى 80.7% حين أخرجت حالة المهمة من السياق وتحقّقت منها من البيئة، وMCP صار stateless.
🗞️ أخبار المختبرات
MCP صار stateless — والخوادم البعيدة صارت أسهل
المصدر: Claude Blog
يوم 28 يوليو أصدرت Anthropic نسخة MCP 2026-07-28 نهائية، أكبر تغيير في البروتوكول منذ إطلاقه، لتحلّ محل 2025-11-25. النواة صارت stateless: تحوّل البروتوكول من اتصال ثنائي الاتجاه يحفظ الحالة إلى نموذج طلب/استجابة، فصار نشر خادم MCP على serverless أو على الحافة ممكنًا بلا التواءات. والصلاحيات تحاذي الآن OAuth 2.0 وOIDC كما تُنشر فعليًا، فيتصل خادمك بأنظمة الهوية مثل Entra وOkta مباشرة. وأُضيف إطار امتدادات مرقّمة: MCP Apps لواجهات يرسمها الخادم داخل iframe معزول، وTasks للعمليات الطويلة وغير المتزامنة. وتقول Anthropic إن تحميلات SDK تجاوزت 400 مليون شهريًا — أربعة أضعاف خلال العام.
الخلاصة لك: إن كان عندك خادم MCP يعمل، اقرأ ما يكسر قبل أن تحدّث. وإن كنت أجّلت بناء واحد لأن استضافته كانت وجعًا، فالعذر سقط: stateless يعني دالة serverless عادية.
OpenAI تكشف Astra ببراهين لا بادّعاءات
المصدر: GitHub — openai/ten-proofs
يوم 1 أغسطس نشرت OpenAI عشرة حلول لمسائل مفتوحة في الرياضيات وعلوم الحاسوب النظرية، وأعلنت في الفقرة الثالثة أن الذي أنتجها نسخة داخلية من Astra — عائلة نموذجها الكبير القادم. المسائل ظلّت بلا تقدّم عقدًا على الأقل، وتغطي نظرية الزمر والهندسة عالية الأبعاد ونظرية الترميز والتعقيد الكمّي وتشفير الشبكات. والمهم للصانع ليس النتيجة بل شكل الإثبات: مخطوطة من 249 صفحة، ومعها شهادات Lean 4 لكل نتيجة على GitHub برخصة Apache-2.0 — أي يستطيع أي أحد أن يفحصها آليًا بدل أن يصدّقها. كلفة الاستدلال كلها نحو $2,000 بأسعار Sol. وAstra لم تُطلق منتجًا بعد: لا سعر ولا نافذة سياق ولا موعد.
الخلاصة لك: الدرس ليس عن الرياضيات. لاحظ ما فعلوه: أرفقوا مع النتيجة ما يثبتها آليًا. اسأل عن مخرجات وكيلك السؤال نفسه — ما الشيء الذي تستطيع آلة أن تفحصه؟ اختبار ينجح، schema يتحقّق، بناء يمرّ. إن لم يوجد، فأنت تصدّق لا تتحقّق.
وبينما كانت البروتوكولات والبراهين تتغيّر في سان فرانسيسكو، جاء من الرياض خبر يقول أين يذهب المال العربي في الذكاء الاصطناعي.
🌍 من العالم العربي
HUMAIN تستثمر في مُزن — أول استثمار سعودي لها
المصدر: Arab News
يوم 3 أغسطس أعلنت HUMAIN، شركة الذكاء الاصطناعي المملوكة لصندوق الاستثمارات العامة، استثمارها في شركة مُزن السعودية وشراكةً معها لبناء حلول ذكاء اصطناعي للمؤسسات — وهذا أول استثمار لها في شركة سعودية. الشراكة تجمع بنية HUMAIN التحتية مع منتجات مُزن وفريق Forward Deployed Engineering عندها، وتستهدف القطاع المالي والجهات الحكومية. ومُزن تخدم اليوم أكثر من 150 عميلًا في هذين القطاعين. أول الحلول تُعرض في LEAP بالرياض، والتوفّر التجاري الأوسع في النصف الثاني من 2026. والهدف المعلن: نقل المؤسسات من التجارب إلى تشغيل حقيقي آمن.
الخلاصة لك: هذه إشارة سوق لا خبر تمويل. المشترون في القطاعات المنظّمة يريدون شيئًا يعمل داخل حدودهم — سيادة البيانات، وفريق يجلس معهم. إن كنت تبيع للبنوك أو للجهات الحكومية عربيًا، فهذان البندان يُغلقان الصفقة، لا قائمة الميزات.
كلفة الاختراق في الشرق الأوسط: 8 ملايين دولار
المصدر: IBM / Zawya
تقرير IBM السنوي عن كلفة اختراق البيانات، الصادر هذا الأسبوع، يضع متوسط كلفة الاختراق في الشرق الأوسط عند 8 ملايين دولار. و26% من الاختراقات الخبيثة استُخدم فيها الذكاء الاصطناعي، و11% إضافية لم يستطع أصحابها الجزم. أما أعلى ثلاثة أسباب ترفع الكلفة في المنطقة فهي: أسرار ومفاتيح تُدار بإهمال، وصلاحيات زائدة وأدوار سيئة التنظيم، وعجز عن ترتيب التهديدات بالأولوية. والمفارقة أن من يستخدم الأتمتة الأمنية والذكاء الاصطناعي على نطاق واسع تنخفض كلفته أكثر من 3 ملايين دولار — و23% لم يعتمدوها بعد.
| القطاع | متوسط الكلفة (مليون $) |
|---|---|
| Financial | 10.67 |
| Technology | 10.67 |
| Industrial | 9.60 |
| Middle East — all sectors | 8.00 |
الخلاصة لك: ابدأ من السطر الأول في قائمة الأسباب: الأسرار والمفاتيح. افتح مستودعك الآن وابحث عن مفتاح API في الكود أو في سجل git — الاختراق الأغلى في المنطقة يبدأ من هناك، لا من هجوم ذكي.
الأرقام تخيف. الأدوات التالية أرخص من سطر واحد في ذلك الجدول.
الرادار يصلك في بريدك كل أسبوع — بلا ضجيج
🛠️ أدوات وريبوز
open-code-review — مراجعة كود من Alibaba تتصدّر GitHub
المصدر: شُهُب
أداة مراجعة الكود مفتوحة المصدر من Alibaba كانت من أسرع المستودعات نموًا هذا الأسبوع: 18,698 نجمة بعد زيادة 3,881 خلال سبعة أيام، أي نحو 238 نجمة يوميًا منذ إنشائها في مايو. تخلط فحوصًا ثابتة بوكيل LLM لتعطي تعليقات على مستوى السطر، ومعها قواعد جاهزة لعدة لغات تغطي NPE وسلامة الـ threads وXSS وSQL injection. مكتوبة بـ Go، رخصتها Apache-2.0، وتندمج في GitHub Actions وGitLab CI.
الخلاصة لك: شغّلها على آخر PR مفتوح عندك قبل أن تقرأه بنفسك، ثم قارن: ما الذي التقطته ولم تنتبه له؟ إن كانت الإجابة «لا شيء»، وفّرت وقتك. وإن التقطت شيئًا واحدًا حقيقيًا، فقد دفعت ثمنها.
i-have-adhd — يمنع وكيلك من دفن الإجابة
المصدر: GitHub
مهارة (skill) صغيرة بلغة Python تعالج شكوى يعرفها كل من يعمل مع وكيل برمجي: الجواب موجود، لكنه مدفون تحت فقرات من الشرح. المستودع وصل إلى 16,617 نجمة و933 fork منذ مايو — نحو 201 نجمة يوميًا — ورخصته MIT. والفكرة نفسها بسيطة: اضبط شكل المخرجات ليأتي الجواب أولًا.
الخلاصة لك: هذه أرخص تجربة في القائمة: ركّبها، واطرح على وكيلك نفس السؤال الذي أزعجك أمس. إن جاء الجواب في السطر الأول، ربحت. الفارق ليس في ذكاء النموذج بل في تنسيق مخرجاته — وهذا تحت يدك.
openwork — بديل مفتوح لـ Claude Cowork
المصدر: GitHub
مشروع TypeScript يقدّم نفسه بديلًا مفتوح المصدر لـ Claude Cowork، مبنيًا فوق opencode. وصل إلى 20,844 نجمة و2,046 fork، بزيادة 3,429 نجمة هذا الأسبوع، وآخر دفعة كود يوم 4 أغسطس. تنبيه قبل أن تبني عليه: GitHub لا يتعرّف على رخصته ضمن الرخص القياسية (NOASSERTION) — اقرأ ملف الرخصة بنفسك قبل أي استخدام تجاري.
الخلاصة لك: جرّبه على مشروع جانبي لا على منتجك. الرخصة غير القياسية ليست بالضرورة مشكلة، لكنها سؤال — والوقت المناسب لطرحه قبل أن يصير المشروع في قلب عملك، لا بعده.
وثلاث من أدوات هذا الأسبوع تشترك مع ورقتين بحثيتين في تشخيص واحد.
🔬 أبحاث بعين الصانع
LongHorizon-Harness — أخرج حالة المهمة من السياق
المصدر: arXiv
ثمانية باحثين نشروا على arXiv (2608.01964) تشخيصًا دقيقًا لسبب فشل الوكلاء في المهام الطويلة: الأطر الحالية تحفظ تنفيذ المهمة وحالتها وتقييم إنجازها كلها داخل سياق يتضخّم، فتضيع الحالة ويتسرّب تقييم خاطئ من الوكيل عن نفسه إلى القرارات التالية. والحل الذي يقترحونه بنيوي: احفظ حالة المهمة خارج التنفيذ، ولا تحدّثها إلا بحقائق تحقّقت من البيئة مستقلةً. حلقتهم اسمها Manage-Execute-Audit: مدير يمسك الحالة ويحدّد المهمة الفرعية التالية، ومنفّذ بسياق نظيف ينجزها، ومدقّق للقراءة فقط يتحقّق من حالة البيئة قبل الجولة التالية.
| المقياس | قبل | بعد |
|---|---|---|
| WeaveBench — Qwen 3.7-Plus | 51.8% | 80.7% |
| Terminal-Bench 2.1 — Qwen 3.7-Plus | 69.7% | 77.2% |
| OSWorld 2.0 — Qwen 3.7-Plus | 2.8% | 8.3% |
| OSWorld 2.0 subset — Claude Opus 4.7 | 20.0% | 34.3% |
الخلاصة لك: لم يغيّروا النموذج، غيّروا مكان الحالة — وارتفع النجاح من 51.8% إلى 80.7%. إن كان وكيلك يتعثّر في المهام الطويلة، فالمشكلة على الأرجح ليست في النموذج. أخرج الحالة إلى مكان تكتبه أنت، ولا تحدّثها إلا بما تتحقّق منه فعلًا: ملف موجود، اختبار مرّ، خدمة ردّت.
SWE-Touch — ماذا يحدث حين تلمس الكود مع وكيلك
المصدر: arXiv
سبعة باحثين (arXiv 2608.02499) سألوا سؤالًا يعرفه كل من يبرمج مع وكيل: ماذا يحدث حين يعدّل إنسان الكود أثناء عمل الوكيل؟ المعايير الحالية تختبر الوكيل وحده، أو تحصر مشاركة المستخدم في الرسائل. فبنوا إطارًا يحقن «تعديلات مضادة» — تغييرات معقولة في كود يخصّ المهمة لكنها تتعارض مع إتمامها — ويوصلها للوكيل مع رسالة سياقية حين يصل إلى ذلك الموضع. النتيجة على تسعة نماذج برمجة: معدّل الحل انخفض 7.7 نقطة مئوية على SWE-bench Verified، والانخفاض استمر على مهام أطول في SWE-Bench Pro وDeepSWE.
الخلاصة لك: إن كنت تعدّل الملفات بينما وكيلك يشتغل عليها، فأنت تدفع 7.7 نقطة من دقّته دون أن تشعر. والقاعدة العملية بسيطة: اقسم الملكية. إمّا يده على الملف أو يدك، ثم أخبره صراحةً بما غيّرت قبل أن يكمل.
ثلاث فرص خرجت من مواد هذا الأسبوع.
💡 أفكار للصنّاع
انقل خادم MCP عندك إلى stateless
المصدر: Claude Blog
النسخة الجديدة من البروتوكول أزالت أثقل ما في التشغيل: الحالة. خادمك صار يستطيع أن يعيش كدالة serverless عادية بلا اتصال مفتوح، وصلاحياته تتصل بـ OAuth/OIDC القياسي. إن كان عندك خادم MCP يحمل حالة بين الطلبات، فهذه فرصة إعادة كتابة صغيرة تشتري لك نشرًا أرخص وتوسّعًا بلا تفكير. وإن لم يكن عندك واحد، فالبناء اليوم أبسط مما كان الأسبوع الماضي.
الخلاصة لك: ابدأ بأصغر أداة عندك — واحدة تقرأ ولا تكتب — وانشرها stateless. حين تعمل، انقل البقية. لا تعِد كتابة كل شيء دفعة واحدة.
اجعل لكل مخرَج من وكيلك شهادة تُفحص
المصدر: GitHub
ثلاثة من عناصر هذا العدد تقول الشيء نفسه: Astra أرفقت شهادات Lean مع براهينها، وLongHorizon-Harness لا تحدّث الحالة إلا بحقيقة تحقّقت من البيئة، وSWE-Touch أظهرت أن الوكيل لا يلاحظ تعديلًا يناقضه. والفرصة هنا: بدل أن تقرأ ملخّص الوكيل، اطلب منه أن يترك أثرًا تفحصه آلة — اختبار يمرّ، مخطط JSON يتحقّق، أمر بناء ينجح. اجعل هذا شرط قبول في خط عملك، لا عادة شخصية.
الخلاصة لك: اكتب القاعدة في مكان واحد: لا يُقبل عمل وكيل بلا شيء يفحصه غيره. سطر واحد في CI يطبّق هذا أفضل من عشر مراجعات يدوية.
افحص أسرارك قبل أن تفحصها جهة أخرى
المصدر: IBM / Zawya
تقرير IBM وضع «أسرار ومفاتيح تُدار بإهمال» في رأس قائمة ما يرفع كلفة الاختراق في المنطقة. وهذه ليست مشكلة شركات كبيرة: مفتاح API في ملف بيئة مرفوع بالخطأ، أو في سجل git، يكفي. والفرصة للصانع العربي مزدوجة — نظّف بيتك أولًا، ثم لاحظ أن أدوات فحص الأسرار كلها تفترض فرق عمل تقرأ الإنجليزية وتتبع سياسات مكتوبة بها.
الخلاصة لك: خصّص ساعة اليوم: شغّل فاحص أسرار على تاريخ مستودعك كله لا على آخر commit. المفاتيح المسرّبة لا تُحذف بحذف الملف — تبقى في السجل حتى تُبطلها أنت.
مصادر هذا العدد (9)
- Claude Blog — https://claude.com/blog/bringing-mcp-2026-07-28-to-claude
- GitHub — openai/ten-proofs — https://github.com/openai/ten-proofs
- Arab News — https://www.arabnews.com/node/2653224/saudi-arabia
- IBM / Zawya — https://www.zawya.com/en/business/average-data-breach-cost-in-middle-east-climbs-to-8mln-ibm-418916
- شُهُب — https://shuhub.ai/ar/products/open-code-review
- GitHub — https://github.com/ayghri/i-have-adhd
- GitHub — https://github.com/different-ai/openwork
- arXiv — https://arxiv.org/abs/2608.01964
- arXiv — https://arxiv.org/abs/2608.02499