وكيل الذكاء الاصطناعي الذي يفتح المتصفح، وينقر داخل موقع، وينهي المهمة نيابة عنك، لم يعد مجرد عرض تجريبي. في 2026 تستطيع تفعيله داخل Chrome، أو استدعاءه عبر واجهة برمجية (API)، أو تشغيله في مساحة عمل سحابية. لكن الصورة الصادقة أكثر تعقيداً من فيديوهات الإطلاق: هذه الوكلاء جيدة في مهام الويب القصيرة والواضحة، وما زالت تتعثر في المهام الطويلة، وتحمل خطراً أمنياً لا تدّعي أي شركة أنها حلّته بالكامل. يشرح هذا الدليل ما يعمل اليوم، وما تُظهره الأبحاث، وطريقة تجهيز عملية تقلل الخطر، مع "بوابة سياسات" مُختبرة بلغة Python تستطيع تعديلها.
ماذا يفعل وكيل التحكم بالكمبيوتر فعلاً؟
الحلقة بسيطة: يستقبل النموذج لقطة شاشة (أو عرضاً منظماً للصفحة)، ويقرر إجراءً واحداً (انقر هنا، اكتب هذا، مرّر، اضغط مفتاحاً)، فينفّذه برنامجك، ويلتقط لقطة شاشة جديدة ويرسلها له. وتتكرر الحلقة حتى تنتهي المهمة أو يستسلم الوكيل. كل ما يعرفه الوكيل عن الصفحة يأتي مما يراه، ولهذا بالضبط تستطيع صفحة ويب أن تؤثر فيه.
أين وصلت المنتجات (أكتوبر 2026)؟
- Claude in Chrome من Anthropic أصبح متاحاً للجميع في كل خطط Claude المدفوعة في 26 أغسطس 2026، بعد عام من الإطلاق التدريجي. ويستطيع الآن التصرف وحده بدل طلب الإذن قبل كل خطوة، مع مصنِّف أمان يفحص كل إجراء، ويستطيع مدراء الشركات حصره في مواقع معتمدة.
- واجهة computer use من Anthropic تتيح للمطورين بناء وكلائهم الخاصين. أدواتها الحالية لم تعد تحتاج ترويسة تجريبية (beta)، وتعمل على Claude API وGoogle Cloud وAmazon Bedrock، وفي نسخة تجريبية على Microsoft Foundry.
- OpenAI تقدم الآن التصفح والتحكم بالكمبيوتر داخل ChatGPT Work، الذي أُعلن في يوليو 2026 وحلّ محل ChatGPT agent السابق. أما متصفحها المستقل Atlas، الذي أُطلق في أكتوبر 2025، فقد أُوقف لاحقاً بحسب صفحة OpenAI نفسها.
- Google تقدم قدرة التحكم بالكمبيوتر في Gemini API (ما زالت بصفة تجريبية)، وأنهت تجربة Project Mariner في 2026، ونقلت تقنيتها إلى Gemini وميزة "التصفح التلقائي" في Chrome، التي وصلت إلى أندرويد في أمريكا لمشتركي AI Pro وUltra في أغسطس 2026.
- متصفح Comet من Perplexity مجاني للجميع منذ أكتوبر 2025.
التوفر يتغير بسرعة، ويعتمد غالباً على الخطة والدولة، فراجع الصفحة الحالية للمزوّد قبل أن تبني على أي منها.
ما مستواها؟ ماذا تقول الاختبارات
OSWorld (2024) كان أول اختبار واسع الاستخدام: 369 مهمة حقيقية على الكمبيوتر عبر تطبيقات ومواقع. عند نشره، أنجز البشر 72.4% منها، وأفضل نموذج 12.2% فقط. وبعد سنتين، تذكر الشركات نتائج تتجاوز 80% في نسخته المنقّحة، أي أن الاختبار الأصلي اقترب من الحل، على الأقل بحسب ما تعلنه الشركات المطوّرة نفسها.
لهذا أطلقت المجموعة البحثية نفسها OSWorld 2.0 في يونيو 2026: 108 مهام طويلة وواقعية يحتاج الشخص نحو 1.6 ساعة لكل منها، وتتطلب نحو 318 إجراءً، مقابل نحو 30 في النسخة الأولى. والنتائج صادمة: أفضل نموذج اختُبر أكمل 20.6% فقط من المهام بالكامل (54.8% مع احتساب الإنجاز الجزئي)، ولم يُكمل أي وكيل أياً من أطول المهام. ويصف الباحثون أسباب الفشل بوضوح: الوكلاء ينسون القيود المطلوبة، ويفوّتون معلومات تصل في منتصف المهمة، ويخمّنون بدل أن يسألوا المستخدم، ويتجاوزون التحقق من عملهم.
نشرت الشركات منذ ذلك الحين أرقاماً أعلى في OSWorld 2.0 لنماذجها الأحدث، لكن بحساب الإنجاز الجزئي، فلا تصح مقارنتها بنسبة الإكمال الكامل في البحث. القراءة العملية: المهام القصيرة والواضحة تنجح جيداً الآن، أما سير العمل الطويل الممتد لساعات فغالباً لا، حتى الآن.
الخطر الحقيقي: حقن الأوامر
وكيل المتصفح يقرأ كل ما في الصفحة، بما في ذلك نصوص لا تراها أنت. وإذا احتوت الصفحة تعليمات موجّهة للوكيل، فقد يتبعها. وهذا ليس نظرياً:
- فريق الأمان في Brave (أغسطس 2025) أثبت أن تعليقاً مخفياً في صفحة على Reddit، مع طلب بسيط مثل "لخّص هذه الصفحة" في متصفح Comet، جعل الوكيل يجلب البريد الإلكتروني للمستخدم ورمز دخول لمرة واحدة من Gmail ويرسلهما للخارج. وفي أكتوبر 2025 أثبتوا النوع نفسه من الهجوم باستخدام نص مخفي داخل الصور، وأثّر ذلك على عدة متصفحات ذكية، وخلصوا إلى أن التصفح بالوكلاء يبقى خطراً بطبيعته حتى يتغير التصميم الأساسي.
- اختبارات Anthropic الهجومية الخاصة على Claude in Chrome وجدت نسبة نجاح للهجمات 23.6% بدون دفاعات، و11.2% مع أول وسائل الحماية (أغسطس 2025). ثم خفّضت النماذج الأحدث والدفاعات المتعددة هذه النسبة بشكل كبير. وفي مجموعة الاختبارات التي استخدمتها Anthropic عند الإطلاق في أغسطس 2026، ظلت الهجمات على النموذج الأقدم Claude Opus 4.5 تنجح بنسبة 16.7% مع تفعيل الحماية، مقابل 0% إلى 0.3% لنماذجها في 2026.
- OpenAI كتبت في ديسمبر 2025 أن حقن الأوامر، "مثل الاحتيال والهندسة الاجتماعية على الويب، من غير المرجح أن يُحل بالكامل أبداً".
التحسن حقيقي، لكن النسبة المنخفضة في اختبارات شركة ما ليست صفراً على الإنترنت المفتوح، والمهاجمون يتكيّفون. الافتراض الآمن هو أن أي صفحة يقرؤها الوكيل قد تحاول توجيهه، وأن التجهيز يجب أن يحدّ مما يستطيع وكيل موجَّه فعله. (دليلنا عن أمان وكلاء الذكاء الاصطناعي وحقن الأوامر يشرح "قاعدة الاثنين" الأساسية.)
تجهيز آمن، من إرشادات الشركات نفسها
توثيق المطورين لدى Anthropic وGoogle يقدم نصائح متسقة، ومع وسائل الحماية المدمجة في المنتجات الاستهلاكية تتلخص في ست قواعد:
- اعزله. شغّل وكلاء المطورين في جهاز افتراضي أو حاوية مخصصة بأقل الصلاحيات. ولإضافات المتصفح، استخدم ملفاً شخصياً منفصلاً في المتصفح، دون أي حسابات بنكية أو صحية أو حكومية مسجّلة فيه.
- حدّد قائمة المواقع المسموحة. احصر الوكيل في النطاقات التي تحتاجها المهمة. أي رابط لموقع آخر يُمنع، لا يُتبع.
- أبعد الأسرار. لا تدع الوكيل يكتب كلمات المرور أو أرقام البطاقات أو رموز الدخول لمرة واحدة. حين يلزم تسجيل الدخول، يتولى الشخص تلك الخطوة.
- أكّد الإجراءات المهمة. الشراء، وإرسال الرسائل، وإرسال النماذج، والحذف، والموافقة على الشروط، كلها تحتاج نقرة من إنسان. وكل من Anthropic وGoogle تبني خطوات تأكيد في أدواتها لهذا السبب.
- لا تحل اختبارات CAPTCHA أبداً. توثيق Google يطلب من الوكلاء ألا يحاولوا حلها أو تجاوزها أبداً. اختبار CAPTCHA إشارة لإعادة التحكم إلى الشخص.
- راقب وسجّل وحدّد. ضع حداً لعدد الخطوات، وسجّل كل إجراء، وراقب أول مرات تشغيل أي مهمة جديدة. ويذكر توثيق Anthropic أن هذه الوكلاء تناسب المهام في الخلفية أكثر من العمل الفوري بسرعة الإنسان، فخطط على هذا الأساس.
مثال مُختبر: بوابة سياسات في الكود
أكثر مكان آمن لهذه القواعد هو كود يقف بين النموذج والمتصفح، لأن نص الصفحة يستطيع مجادلة التعليمات، لكنه لا يستطيع مجادلة جملة if. السكربت التالي لا يحتاج متصفحاً ولا مفتاح API. يفحص كل إجراء يقترحه الوكيل مقابل قائمة مواقع مسموحة، وقائمة إجراءات تحتاج تأكيداً دائماً، وقائمة إجراءات ممنوعة على الوكيل، وحد لعدد الخطوات. الخطة مكتوبة مسبقاً: طلب المستخدم من الوكيل إعادة طلب ورق الطابعة، والخطوة 4 هي ما حاولت تعليمات مخفية في صفحة المورّد تحفيزه.
"""A policy gate for a browser agent (no API key or browser needed).
Every action the model proposes passes through check() before it runs.
The rules live in code, so text on a web page can't talk its way past them.
"""
from urllib.parse import urlparse
ALLOWED_DOMAINS = {"supplier-portal.example", "docs.example"}
ALWAYS_CONFIRM = {"purchase", "submit_form", "send_message", "delete"}
NEVER = {"enter_password", "enter_card", "solve_captcha", "download_run"}
MAX_STEPS = 30
def domain(url):
host = urlparse(url).hostname or ""
return host[4:] if host.startswith("www.") else host
def check(action, step):
kind, url = action["kind"], action.get("url", "")
if step > MAX_STEPS:
return "STOP", f"step budget of {MAX_STEPS} used up; report progress to the user"
if kind in NEVER:
return "BLOCK", f"'{kind}' is never done by the agent; hand control to the user"
if url and domain(url) not in ALLOWED_DOMAINS:
return "BLOCK", f"{domain(url)} is not on the allowlist"
if kind in ALWAYS_CONFIRM:
return "ASK", f"needs the user's confirmation: {action.get('summary', kind)}"
return "ALLOW", "read-only or low-risk"
# Scripted plan: the user asked the agent to re-order printer paper.
# Step 4 is what a hidden instruction on the supplier page tried to trigger.
plan = [
{"kind": "open", "url": "https://supplier-portal.example/orders"},
{"kind": "read", "url": "https://supplier-portal.example/orders/1182"},
{"kind": "add_to_cart", "url": "https://supplier-portal.example/item/a4-paper"},
{"kind": "open", "url": "https://free-gift-claim.example/login"},
{"kind": "enter_password","url": "https://supplier-portal.example/login"},
{"kind": "solve_captcha", "url": "https://supplier-portal.example/checkout"},
{"kind": "purchase", "url": "https://supplier-portal.example/checkout",
"summary": "pay 240 AED for 10 boxes of A4 paper"},
]
for i, action in enumerate(plan, 1):
verdict, why = check(action, i)
print(f"{i}. {action['kind']:14} {verdict:5} {why}")
print("\nstep 31:", *check({"kind": "read", "url": "https://docs.example/a"}, 31))
النتيجة، عند التشغيل بتاريخ 2026-10-07:
1. open ALLOW read-only or low-risk
2. read ALLOW read-only or low-risk
3. add_to_cart ALLOW read-only or low-risk
4. open BLOCK free-gift-claim.example is not on the allowlist
5. enter_password BLOCK 'enter_password' is never done by the agent; hand control to the user
6. solve_captcha BLOCK 'solve_captcha' is never done by the agent; hand control to the user
7. purchase ASK needs the user's confirmation: pay 240 AED for 10 boxes of A4 paper
step 31: STOP step budget of 30 used up; report progress to the user
ماذا فعلت البوابة:
- مرّ التصفح العادي: فتح سجل الطلبات، وقراءة طلب قديم، وإضافة الورق إلى السلة.
- مُنع الانحراف المحقون: موقع "الهدية المجانية" ليس في قائمة المواقع المسموحة، فلن يصل إليه الوكيل مهما كانت التعليمات مقنعة.
- عادت كلمات المرور واختبارات CAPTCHA إلى الشخص. هذه لحظات تسليم، لا عمل للوكيل.
- توقف الدفع بانتظار التأكيد، مع ملخص واضح لما سيُشترى وبكم.
- حد الخطوات يوقف الحلقات التي لا تنتهي، ويجعل الوكيل يبلّغ عن تقدمه بدل أن يتجول بلا هدف.
المنتجات الحقيقية تطبّق نسخاً أغنى من الأفكار نفسها (صلاحيات المواقع، ومصنِّفات الإجراءات، ونوافذ التأكيد). وإذا بنيت وكيلك الخاص، فاكتب هذه الطبقة أولاً.
فيمَ تنفع هذه الوكلاء اليوم؟
- مناسبة لـ: جمع معلومات من عدة مواقع في جدول واحد، وتعبئة نماذج ويب متكررة من بيانات تقدّمها أنت (مع مراجعة نهائية)، ومتابعة حالة الطلبات أو الشحنات، والأعمال الإدارية الروتينية في لوحات التحكم على الويب، واختبار مسارات موقعك أنت.
- غير مناسبة حالياً لـ: أي شيء يتعلق بالمال دون مراجعة بشرية، والمهام التي تحتاج حساباتك على مواقع حساسة، وسير العمل الطويل الممتد لساعات، والمواقع ذات الحماية القوية ضد الروبوتات.
والتكلفة مهمة أيضاً. كل خطوة ترسل لقطة شاشة (تقدّر Anthropic كل واحدة بنحو 1,000 إلى 1,800 وحدة نصية، إضافة إلى تعريف الأداة)، فمهمة من 50 خطوة تتراكم تكلفتها. وفضّل واجهة برمجية أو موصلاً منظماً على النقر في الشاشة كلما وُجد، فهو أسرع وأرخص وأصعب في التلاعب. (المزيد عن خفض فواتير الوكلاء في كيف تخفّض تكلفة وكلاء الذكاء الاصطناعي.)
الخلاصة
وكلاء المتصفح والتحكم بالكمبيوتر انتقلوا في 2026 من مرحلة التجربة إلى مرحلة الفائدة، في المهام القصيرة المحددة جيداً. لكنها ليست موثوقة بعد في سير العمل الطويل، وحقن الأوامر خطر تديره، لا خطر تلغيه. أعطِ الوكيل ملفاً شخصياً أو جهازاً منفصلاً، وقائمة قصيرة من المواقع المسموحة، ولا أسرار، ونقرة من إنسان قبل أي شيء ينفق مالاً أو لا يمكن التراجع عنه. ثم ابدأ بمهمة صغيرة ومملة ومتكررة، وراقبها وهي تعمل.
المصادر: Xie وآخرون، "OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments" (2024)؛ "OSWorld 2.0: Benchmarking Computer Use Agents on Long-Horizon Real-World Tasks" (يونيو 2026)؛ Anthropic، إعلان Claude for Chrome (أغسطس 2025)، وإتاحة Claude in Chrome للجميع (26 أغسطس 2026)؛ توثيق أداة computer use من Anthropic؛ توثيق computer use في Gemini API من Google؛ أبحاث الأمان من Brave عن حقن الأوامر غير المباشر في المتصفحات الذكية (أغسطس وأكتوبر 2025)؛ OpenAI، منشور عن تقوية ChatGPT Atlas ضد حقن الأوامر (ديسمبر 2025)، وإعلان ChatGPT Work (يوليو 2026). راجعناها في أكتوبر 2026، والمنتجات تتغير بسرعة.