خبير
⏱ ٦٠ دقيقة قراءة
© بوابة الذكاء الاصطناعي ٢٠٢٦-٠٤-٢١
رؤية-لغة-عمل للمؤسسات: تصميم وكيل سطح مكتب مستقل باستخدام Claude 4.5
الانتقال من روبوتات الدردشة النصية إلى مشغلي الأنظمة المستقلة. تعلم كيفية تنظيم سير العمل لرؤية-لغة-عمل (VLA) بشكل آمن لتمكين الذكاء الاصطناعي من التنقل في الواجهات الرسومية، والتفاعل مع البرمجيات القديمة الخاصة، وأداء التفكير المكاني المعقد.
المتطلبات الأساسية
- Python 3.12+ (يوصى ببيئة المؤسسات)
- Anthropic Tier 3+ API Access (مطلوب لحدود التردد العالية متعددة الوسائط لـ Claude 4.5)
- Docker Engine (مطلوب بشدة لتوفير بيئة Xvfb الافتراضية)
- فهم متقدم لتخطيط إحداثيات واجهة المستخدم، تجريد DOM، وترميز الصور base64
فهم نموذج VLA
تتفاعل نماذج اللغة الكبيرة القياسية (LLMs) بشكل بحت عبر نقاط نهاية API وتيارات نصية. ومع ذلك، فإن ٨٠٪ من برمجيات المؤسسات — مثل أنظمة ERP القديمة، عملاء قاعدة البيانات المحلية GUI، أو بوابات الرعاية الصحية المخصصة — تفتقر إلى واجهات API قوية. هنا تأتي نماذج رؤية-لغة-عمل (VLA) لسد الفجوة.
من خلال الاستفادة من بنية “استخدام الكمبيوتر” في Claude 4.5، يعمل الوكيل تمامًا مثل الموظف البشري: “يرى” الشاشة عبر أخذ عينات بصرية مستمرة، “يفكر” في خطوات سير العمل اللازمة باستخدام التفكير المكاني الكثيف، و”يعمل” من خلال التحكم في الفأرة ولوحة المفاتيح الفعلية.
الخطوة ١: تعزيز البيئة والعزل (مهم)
يحمل التحكم في واجهة المستخدم مخاطر شديدة، بما في ذلك الحذف العرضي للبيانات أو التعديلات غير المقصودة على نظام المضيف. لا تقم أبدًا بتنفيذ وكلاء VLA مباشرة على جهازك المضيف. يجب علينا عزل الوكيل داخل حاوية Ubuntu مزودة بعرض افتراضي (Xvfb).
قم بإنشاء Dockerfile التالي لتوفير بيئة تنفيذ آمنة:
FROM python:3.12-slim
# Install X virtual framebuffer and UI automation dependencies
RUN apt-get update && apt-get install -y
xvfb
x11-utils
scrot
python3-tk
python3-dev
&& rm -rf /var/lib/apt/lists/*
WORKDIR /app
COPY requirements.txt .
RUN pip install --no-cache-dir -r requirements.txt
# Start virtual display on port :99 before executing the Python agent
CMD ["sh", "-c", "Xvfb :99 -screen 0 1920x1080x24 & export DISPLAY=:99 && python agent_core.py"]
يجب أن يتضمن requirements.txt الخاص بك: anthropic pyautogui mss opencv-python-headless python-dotenv.
الخطوة ٢: وحدة القياس البصري
يتطلب الوكيل تدفقًا بصريًا عالي الدقة. نستخدم mss لالتقاط الشاشة بزمن انتقال منخفض للغاية. في هذا المقتطف الجاهز للإنتاج، نقدم وحدة logging الأصلية في Python للحفاظ على سجل تدقيق لإدراك الوكيل.
import mss
import base64
import logging
from PIL import Image
import io# Initialize enterprise logging
logging.basicConfig(level=logging.INFO, format='%(asctime)s - [AGENT-VISION] - %(levelname)s - %(message)s')
logger = logging.getLogger(__name__)def capture_visual_context():
"""Captures the virtual display and encodes it for Claude 4.5 ingestion."""
try:
with mss.mss() as sct:
monitor = sct.monitors[1] # Target the Xvfb primary display
sct_img = sct.grab(monitor)
# Convert to PIL Image for optimization
img = Image.frombytes("RGB", sct_img.size, sct_img.bgra, "raw", "BGRX")
# Downscale to 1280x720 to optimize token consumption while preserving UI text legibility
img.thumbnail((1280, 720))
buffered = io.BytesIO()
img.save(buffered, format="JPEG", quality=85)
logger.info(f"Visual context captured at resolution: {img.size}")
return base64.b64encode(buffered.getvalue()).decode('utf-8')
except Exception as e:
logger.error(f"Visual telemetry failure: {e}")
...تابع القراءة
سجل دخولك مجاناً لقراءة المقال كاملاً والوصول إلى أدوات الذكاء الاصطناعي.
تسجيل الدخول / إنشاء حساب