تواجه نماذج الرؤية الحاسوبية الحديثة صعوبة لافتة في فهم الحجم الحقيقي للأشياء عندما تكون بعيدة عن الكاميرا، حتى لو كانت تلك الأشياء معالم شهيرة ومعروفة عالمياً. المشكلة لا تتعلق بالتعرف على الشكل فقط، بل بتقدير المقياس بدقة: هل المبنى في الخلفية ضخم فعلاً، أم أنه مجرد عنصر صغير يبدو كبيراً بسبب زاوية التصوير؟
وتصبح هذه الثغرة أكثر وضوحاً في الصور المفتوحة التي تجمع بين عناصر قريبة وأخرى بعيدة، حيث تنجح النماذج في وصف المشهد بصرياً، لكنها تفشل أحياناً في استنتاج الأبعاد الفيزيائية الصحيحة. هذه الفجوة تعني أن النموذج قد يحدد برجاً أو نصباً تاريخياً بشكل صحيح، ثم يمنحه قياساً أقل بكثير من حجمه الواقعي.
الدراسة الجديدة التي تناولت هذه المشكلة تركّز على ما يسميه الباحثون انهيار المقياس، وهي حالة تميل فيها النماذج إلى التقليل من حجم العناصر البعيدة بشكل منهجي. ويظهر ذلك بوضوح في المعالم المعمارية والبيئات الخارجية الواسعة، حيث تبدو النتيجة أحياناً منطقية للعين البشرية، لكنها غير دقيقة هندسياً.
لماذا تفشل النماذج في قراءة الحجم
تعلّم الإنسان إدراك المسافات والأحجام منذ الطفولة من خلال الخبرة البصرية والحركة والمقارنة المستمرة بين العناصر. أما النماذج القائمة على الرؤية الحاسوبية، فتعتمد غالباً على أنماط متكررة في بيانات التدريب وعلى إشارات بصرية قد لا تكفي لاستنتاج المقياس الحقيقي. لذلك، قد تتعامل مع المباني البعيدة كما لو كانت أجساماً ثنائية الأبعاد بلا عمق واضح.
المشكلة تزداد عندما يكون العنصر البعيد مشهوراً وله نسخ أو أشكال مشابهة في أماكن متعددة. في هذه الحالات، قد تعتمد الخوارزمية على “اختصار” تعلمته من البيانات بدل أن تفهم المشهد فعلياً، فتتوقع حجماً مناسباً في بيئات معينة، لكنه يصبح خاطئاً تماماً في مشاهد جديدة أو غير مألوفة.
هذا النوع من الأخطاء مهم بشكل خاص في تطبيقات مثل الروبوتات، والخرائط ثلاثية الأبعاد، والملاحة الذاتية، والواقع المعزز، لأن تقدير العمق والحجم ليس مجرد تفصيل بصري، بل جزء أساسي من تفسير البيئة والتفاعل معها.
MetricScenes: محاولة لبناء فهم أدق للمقياس
للتعامل مع هذه الفجوة، قدم باحثون من الولايات المتحدة والصين مجموعة بيانات جديدة تحمل اسم MetricScenes. الفكرة الأساسية وراء المشروع هي تزويد النماذج ببيانات متنوعة ومقاسة بدقة أكبر، بحيث لا تقتصر على مجال واحد مثل تصوير السيارات أو المشاهد الداخلية، بل تشمل أيضاً لقطات خارجية، ومعالم حضرية، ومشاهد جوية، وبيئات طبيعية.
تستند المجموعة إلى دمج ثلاثة مصادر بيانات قائمة، هي MegaScenes وAerialMegaDepth وStereo4D، ثم إعادة تنظيمها بحيث تصبح مناسبة لتعليم النماذج كيف تستنتج الأحجام الحقيقية في العالم المفتوح. ويشمل ذلك صوراً فوتوغرافية من الإنترنت، ولقطات جوية، ومقاطع ستيريو ثلاثية الأبعاد، إضافة إلى بيانات كاميرا وخرائط عمق محسوبة بعناية.
هذا الدمج مهم لأن كل مجموعة وحدها تغطي زاوية محدودة فقط من المشكلة. بعض البيانات ممتازة في مشاهد الشوارع، وأخرى قوية في اللقطات الداخلية، لكن جمعها في إطار واحد يمنح النموذج تنوعاً أكبر في الزوايا والمسافات وأنواع العناصر المرئية، وهو ما يساعد على بناء فهم هندسي أشمل.
كيف جرى بناء البيانات
اعتمدت عملية البناء على ربط الصور بالواقع الفعلي عبر بيانات جغرافية ومعلومات مواقع معروفة. في حالات كثيرة، استخدم الباحثون صوراً مرتبطة بإحداثيات جغرافية أو بنماذج خرائط معروفة، ثم طابقت الخوارزميات هذه الصور مع أبعاد حقيقية لمبانٍ ومعالم محددة.
كما استُخدمت تقنيات إعادة البناء ثلاثي الأبعاد، مثل Structure from Motion وMulti-View Stereo، لاستخراج بنية المشهد. لكن هذه التقنيات وحدها لا تكفي دائماً، لأن بعض المناطق تكون غير مكتملة أو تحتوي على ضوضاء أو أخطاء في العمق. لهذا أضيفت مرحلة استكمال للعمق باستخدام أسلوب من مرحلتين، يدمج بين تقديرات المقدمة من نموذج مثل MoGe-2 وبين معلومات الخلفية المستخرجة من إعادة البناء متعدد الرؤى.
الفكرة في هذه المرحلة هي الحفاظ على تفاصيل العناصر القريبة، وفي الوقت نفسه تثبيت الخلفية على مقياس واقعي حتى لا تنهار الأبعاد مع ازدياد المسافة. ويبدو هذا ضرورياً لأن الصور الواقعية غالباً ما تكون غير مكتملة العمق في كل أجزائها، خاصة عندما تكون اللقطات مأخوذة من الإنترنت أو من تسجيلات متعددة الأجهزة.
أرقام المجموعة وما الذي تغطيه
تتكون MetricScenes في نسختها النهائية من 47,579 صورة حقيقية بالكامل من 134 مشهداً من AerialMegaDepth، و29,583 صورة من 356 مشهداً من MegaScenes، و22,549 إطاراً مأخوذاً من 1,725 فيديو من Stereo4D.
وتغطي المجموعة أنماطاً متعددة من المشاهد، تشمل الداخل والخارج، الأرض والجو، المدن والطبيعة، إضافة إلى لقطات معمارية ومعالم شهيرة. هذا التنوع هو ما يمنحها قيمتها البحثية، لأنه يخلق سياقاً مشتركاً لم يكن متاحاً بهذه الصورة في أي من المصادر الأصلية على حدة.
ولضمان التقييم العادل، احتفظ الباحثون بعدد من المشاهد كبيانات تحقق، ثم استخدموا بقية المحتوى في التدريب والاختبار. كما جرى اختبار النموذج على بيانات معيارية معروفة مثل NYUv2 وKITTI وETH3D وغيرها، بهدف التأكد من أن التحسن في تقدير المقياس لم يأتِ على حساب الجودة العامة لإعادة البناء الهندسي.
نتائج الاختبار على النماذج
بعد تدريب نموذج MoGe-2 على البيانات الجديدة، ظهرت نسخة محسنة أطلق عليها الباحثون اسم WildMoGe. وأظهرت النتائج أن النموذج الجديد أصبح أكثر قدرة على استعادة الحجم الحقيقي للمعالم، خصوصاً في المشاهد غير المألوفة التي لم تكن موجودة في بيانات التدريب الأصلية.
في المقارنات النوعية، قدّم WildMoGe تقديرات أقرب إلى الأبعاد الحقيقية لبعض المعالم الشهيرة، بينما واصلت نماذج أخرى مثل MoGe-2 وDepthAnything V3 وMetric3D V2 الميل إلى تصغير العناصر البعيدة. أما UniDepth v2 فأظهر أداء أكثر واقعية في بعض الحالات، لكنه ظل غير ثابت، في حين ارتكب DepthPro أخطاء أكبر في تقدير المقياس في مشاهد معينة.
الأهم من ذلك أن التحسن لم يقتصر على المعالم الكبيرة فقط. فعند اختباره على مشاهد داخلية ولقطات شوارع عادية، بقي الأداء متقارباً مع النموذج الأساسي في كثير من الحالات، مع تحسن ملحوظ في بعض المعايير، ما يشير إلى أن الفائدة لا تتعلق بنوع واحد من المشاهد بل تمتد إلى الفهم الهندسي العام.
ماذا تقول هذه النتيجة عن مستقبل الرؤية الحاسوبية
تشير هذه الدراسة إلى أن تعليم النماذج على بيانات مترية حقيقية قد يكون أحد المسارات المهمة لتقليل أخطاء الحجم والعمق. فبدلاً من الاعتماد على صور كثيرة لكنها غير دقيقة من حيث المقياس، يصبح من الضروري بناء مجموعات بيانات قادرة على ربط المشهد المرئي بأبعاده الفعلية.
كما توضح النتائج أن تحسين فهم المقياس لا يتطلب بالضرورة التضحية بالأداء العام. فالنموذج المحسن احتفظ بقدرة جيدة على التعامل مع معايير هندسية شائعة، ما يعني أن المشكلة ليست في إعادة البناء ثلاثي الأبعاد وحدها، بل في كيفية إدخال الإشارات المترية إلى عملية التدريب بطريقة أكثر اتساقاً.
وفي التطبيقات العملية، يمكن أن ينعكس ذلك على دقة أفضل في تحليل البيئات الحضرية، وفهم المسافات في الأنظمة الآلية، وتحسين النمذجة ثلاثية الأبعاد للمواقع الخارجية، وحتى تقليل الأخطاء في أنظمة الذكاء الاصطناعي التي تقرأ الصور وتصفها للإنسان.
خلاصة
تكشف MetricScenes عن نقطة ضعف أساسية في نماذج الرؤية الحديثة: معرفة ما يوجد في الصورة لا تعني بالضرورة فهم حجمه الحقيقي. وبينما تتقدم النماذج بسرعة في التعرف البصري والوصف اللغوي، يظل إدراك المقياس الفيزيائي تحدياً معقداً يحتاج إلى بيانات أدق، ومقاييس أوضح، وتدريب أكثر ارتباطاً بالعالم الحقيقي.
وتبدو أهمية هذه الخطوة في أنها لا تقدم مجرد تحسين تقني محدود، بل تفتح باباً أوسع لإعادة التفكير في طريقة تعليم النماذج كيف “ترى” المسافات والأحجام، لا كيف تتعرف على الأشكال فقط.