لماذا يجيب روبوت الدردشة عن السؤال الخطأ
صور الألف والتاء المربوطة والأرقام العربية تحوّل الكلمة الواحدة إلى عدة سلاسل نصية. الآلية الدقيقة لهذا الخلل، والترتيب الصحيح لتوحيد النص قبل أي مقارنة.

حين يجيب مساعد آلي عن نصف الأسئلة بعبارة «لا تتوفر لديّ معلومات عن ذلك»، يكون الافتراض الأول دائماً أن قاعدة معرفته صغيرة. غالباً لا تكون كذلك. المشكلة أن البرنامج يرى الكلمة الواحدة عدة سلاسل نصية مختلفة.
الإجابة المختصرة
في الكتابة بالحرف العربي — عربية كانت أم فارسية — تُكتب الكلمة الواحدة بأشكال متعددة تبدو متطابقة للقارئ ومختلفة تماماً للحاسوب. «الذكاء الاصطناعي» بألف همزة وبألف مجردة سلسلتان مختلفتان. وما لم يُوحَّد النص قبل أي مقارنة، ستضيع نسبة كبيرة من الأسئلة الحقيقية دون أن يظهر أي خطأ في السجلات.
كلمة واحدة، رسوم متعددة
لا شيء مما يلي خطأ إملائي؛ جميعها ترد في النصوص المنشورة، وجميعها مرمَّزة بشكل منفصل في يونيكود:
- صور الألف: أ (U+0623) وإ (U+0625) وآ (U+0622) وا (U+0627). من يكتب «إدارة» ومن يكتب «ادارة» يقصدان الشيء نفسه.
- التاء المربوطة والهاء: «شركة» و«شركه» تردان معاً في المدخلات الفعلية.
- الياء والألف المقصورة: ي (U+064A) وى (U+0649) تتبادلان حسب لوحة المفاتيح والبلد.
- التطويل (U+0640): محرف زخرفي يبقى في النص المنسوخ ويكسر المطابقة بصمت.
- التشكيل: الفتحة والضمة والشدة، إن بقيت في المدخل، تجعل الكلمة سلسلة أخرى.
- الأرقام: «١٤٠٥» بالأرقام العربية الهندية (U+0660–U+0669) و«1405» بالأرقام اللاتينية ترميزان منفصلان لعدد واحد.
- محرف الوصل الصفري (U+200C): عرضه صفر ولا يُرى، لكنه مخزَّن في السلسلة؛ وهو شائع جداً في الفارسية.
أي أن لمصطلح عادي مثل «روبوت الدردشة» أربع صور مكتوبة شائعة على الأقل، كلها صحيحة. والنظام الذي يعرف واحدة منها يخذل ثلاثة مستخدمين من كل أربعة.
لماذا لا يظهر خطأ في السجلات
هذا الجزء هو سبب بقاء المشكلة. عند فشل المطابقة لا ينهار البرنامج، بل ينتقل إلى الرد الافتراضي. يسجّل الخادم الرمز 200، وتبقى مؤشرات الجاهزية خضراء، ولا تتحول أي لوحة قياس إلى الأحمر.
العَرَض الوحيد من الخارج أن المستخدم يسأل مرة واحدة، يتلقى رداً عاماً، ويغلق النافذة. هذا النمط كان موجوداً في نظامنا نفسه ولم يُكتشف إلا بعد تشغيل مجموعة أسئلة حقيقية عليه. الطريقة العملية في كيف تختبر روبوت الدردشة اختباراً حقيقياً.
الفخ الثاني: المطابقة الجزئية
لنفترض أن النظام يحدد الموضوع بالبحث عن كلمات مفتاحية داخل نص السؤال. هذا أبسط أسلوب، وفيه عيب جوهري: اللغات المكتوبة بالحرف العربي تلصق السوابق واللواحق بحرية.
مثال حقيقي من نظامنا: سُجّلت كلمة مفتاحية للدلالة على أسئلة الجدول الزمني، فوُجدت كسلسلة جزئية داخل كلمة أخرى تماماً في سؤال عن التدريب المؤسسي، وكانت الإجابة جدولاً زمنياً للمشروع لا علاقة له بالسؤال.
الحل هو المقارنة على مستوى الكلمة الكاملة لا السلسلة الجزئية، مع السماح بمطابقة البداية فقط للكلمات الطويلة بما يكفي كي لا يكون التشابه مصادفة.
الترتيب الصحيح للتوحيد
قبل أي مقارنة، يجب أن يمر النص الوارد والنص المرجعي بالمسار نفسه:
١. إزالة التشكيل والتطويل ٢. تحويل محرف الوصل الصفري وعلامات الاتجاه إلى مسافة عادية ٣. تحويل الأرقام العربية الهندية إلى لاتينية ٤. توحيد الحروف: صور الألف إلى ألف مجردة، التاء المربوطة إلى هاء، الألف المقصورة إلى ياء ٥. تصغير الأحرف اللاتينية ٦. تحويل كل محرف ليس حرفاً ولا رقماً إلى مسافة، ودمج المسافات المتتالية
الدقة في الخطوة الثانية: محرف الوصل الصفري يجب أن يتحول إلى مسافة، لا أن يُحذف. فحذفه يلصق الكلمتين ببعضهما ولا يطابق الصورة المكتوبة بمسافة، بينما تحويله إلى مسافة يجعل الرسمين يلتقيان.
لماذا يهم هذا أكثر في التطبيق الفعلي
يراسل عملاء أي متجر أو مركز تدريب أو مصنع من أجهزة ولوحات مفاتيح مختلفة، ومن بلدان تختلف فيها الإعدادات الافتراضية. أي أن كل صور الكتابة حاضرة فعلياً في الرسائل الواردة.
النظام الذي جُرِّب على نص نظيف وموحد فقط يعمل بلا عيب في العرض التقديمي ويتعثر عند أول تماس مع مستخدم حقيقي. يجري فريقنا في مجمّع البرز للعلوم والتقنية بمدينة كرج هذا القياس على حركة الرسائل الحقيقية لا على نص مُصطنع، لأن الفارق بين الاثنين هو الفارق بين عرض ناجح وخدمة يُعتمد عليها.
الأسئلة المتكررة
ما محرف الوصل الصفري ولماذا يسبب المشكلة؟
هو المحرف U+200C في يونيكود: عرضه صفر ولا يُرى، لكنه يُخزَّن ضمن السلسلة. لذلك يتطابق الشكلان للعين ويختلفان في أي مقارنة نصية.
هل يقتصر الأثر على روبوتات الدردشة؟
لا. كل موضع تُقارَن فيه النصوص يتأثر: البحث عن منتج، مطابقة اسم عميل، مطابقة عنوان، وإزالة التكرار. وفي قاعدة البيانات يبقى الرسمان سجلَّين منفصلين لجهة واحدة.
ما نسبة الأسئلة التي تفشل لهذا السبب؟
لا رقم ثابت؛ يعتمد على المفردات. في قياس نظامنا، قبل التوحيد، كانت ثلاثة أسئلة من كل عشرة أسئلة عادية تماماً تصل إلى الرد الافتراضي؛ وبعده وصلت العشرة كلها إلى الموضوع الصحيح.
هل تتجنب النماذج اللغوية الكبيرة هذه المشكلة؟
هي أكثر تسامحاً مع اختلاف الرسم، لكنها لا تُلغي المسألة: في أي موضع تحدث فيه مطابقة نصية قبل النموذج أو بعده — استرجاع مستند، تصفية، توجيه إلى قسم — يعود الفخ نفسه. قارنّا المعماريتين في نموذج لغوي أم استرجاع من معرفة المؤسسة.
ما تكلفة خطوة التوحيد حسابياً؟
ضئيلة. ست عمليات استبدال على سلسلة قصيرة. في قياسنا بلغ زمن المعالجة كاملاً على الخادم، شاملاً استرجاع الإجابة، من ١٠ إلى ١٤ جزءاً من الألف من الثانية. وتكلفة إهمالها أعلى بكثير.
خدمات قطره ذات الصلة
- روبوت دردشة مؤسسي — ردود آلية مبنية على معرفة مؤسستكم
- أتمتة العمليات بالذكاء الاصطناعي — إنهاء العمل المتكرر
- الرؤية الحاسوبية — استخراج الأرقام من صور الكاميرات
- علم البيانات — التنبؤ ولوحات القرار
- الروبوتات — التعليمية والخدمية والصناعية
- دورات الذكاء الاصطناعي — تدريب عملي للفرق التقنية
- التدريب المؤسسي — برامج مبنية على عمليات مؤسستكم
- استشارات الذكاء الاصطناعي — من دراسة الجدوى إلى خارطة الطريق
- الذكاء الاصطناعي في كرج — جميع الخدمات حضورياً في كرج والبرز