ماذا يحدث بين لا تبقى أنت وروبوت الدردشة الذي يعمل بالذكاء الاصطناعي دائمًا بينك وبين روبوت الدردشة. فقط اسأل جوجل.
خلال عطلة نهاية الأسبوع، تفاجأ الناس عندما اكتشفوا أنه يمكن العثور بسهولة على بعض محادثات Anthropic Claude عبر البحث على الويب. كشفت هذه المشكلة، التي يبدو أنه تم الإبلاغ عنها لأول مرة بواسطة أحد مستخدمي موقع redditor، عن محادثات تضمنت أشخاصًا يطلبون النصيحة حول الحزب السياسي الذي يجب عليهم الانضمام إليه، وما إذا كان المحامون في كانساس مطالبين بالإبلاغ الذاتي عندما يعتقدون أنهم ارتكبوا انتهاكًا أخلاقيًا، ولعب الأدوار المثيرة.
يسمح Claude للمستخدمين بمشاركة “لقطات” من الدردشات مع أشخاص آخرين عن طريق إنشاء عنوان URL عام لسلسلة محادثات chatbot محددة. تعود أسباب فهرسة بعض عناوين URL هذه بواسطة محركات البحث الرئيسية إلى الوظائف الأساسية لمواقع الويب ومحركات البحث وتصادم الاثنين عندما يدخل الذكاء الاصطناعي التوليدي في هذا المزيج.
في الأساس، تقوم Anthropic بإرشاد برامج زحف الويب، مثل تلك التي تستخدمها محركات البحث مثل Google وBing، بعدم فهرسة الدردشات التي يقرر المستخدم مشاركتها مع أشخاص آخرين. تقوم الشركة بذلك عبر ما يسمى ملف robots.txt، والذي يعتبر منذ فترة طويلة الطريقة القياسية لإخبار أدوات استخراج بيانات الويب عن أجزاء الموقع المناسبة للوصول إليها. لقد جعل ملف robots.txt الخاص بـ Anthropic الدردشات “المشتركة” محظورة على أدوات استخراج البيانات على الويب منذ سبتمبر 2025 على الأقل، وفقًا للقطة على Wayback Machine.
ولكن منع تضمين الصفحات في نتائج محرك البحث أصعب مما قد تتوقعه.
Bing، الذي لا يزال يعرض “حوالي 612 نتيجة” إذا بحثت عن “site: claude.ai/share” في وقت كتابة هذه السطور، يقول في وثائقه الفنية أنه يمكن للمطورين حظر برامج زحف الويب الخاصة بمحرك البحث باستخدام ملف robots.txt – ولكن يجب على مطوري الويب أيضًا تضمين علامة “noindex” على الصفحات الفردية أيضًا.
تم حذف بعض الدردشات التي ظهرت في نتائج البحث التي تم وضع علامة عليها في منشور Reddit بحلول الوقت الذي عرضتها فيه WIRED، ولم تعد النتائج تظهر في Google عند البحث عن استعلام “مشاركة” الذي لا يزال يعمل على Bing. في دليل المطورين، تقول Google إنها تتجاهل تعليمات robots.txt إذا تم ربط تلك الصفحة من مكان آخر على الإنترنت ولم يقم مالك الصفحة أيضًا بتضمين علامة html خاصة “noindex” على الصفحة أو “علامة x-robots” في رأس استجابة الصفحة.
قامت WIRED بمراجعة عينة من صفحات دردشة Claude المكشوفة ووجدت أنها لم تتضمن علامة “noindex” التي يقول كل من Bing وGoogle إنهما يأخذانها في الاعتبار عند تحديد ما إذا كان سيتم فهرسة الصفحة أم لا.
ولم تقدم شركة مايكروسوفت، التي تمتلك محرك البحث Bing، أي تعليق قبل النشر. لم تستجب الأنثروبيك لطلبات متعددة للتعليق.
أخبر المتحدث باسم Google، نيد أدريانس، WIRED أن فهرسة محادثات Claude المشتركة هي مسؤولية Anthropic. “لا يتحكم Google ولا أي محرك بحث آخر في الصفحات التي يتم نشرها للعامة على الويب، وتم فهرسة هذه الصفحات عبر العديد من محركات البحث”.
يقول أدريانس. “نحن نمنح مالكي المواقع ضوابط واضحة لتحديد ما إذا كان من الممكن الزحف إلى الصفحات أو فهرستها، ونحن نحترم دائمًا هذه التوجيهات.”
لم ترد Anthropic على الأسئلة حول سبب عدم تضمين علامة “noindex” في صفحات الدردشة المشتركة.
في سبتمبر الماضي، حصلت Anthropic على انتقادات لنفس المشكلة، وأخبرت Forbes أنها تستخدم ملف robots.txt للسماح لبرامج الزحف بمعرفة أنه لا ينبغي لها الوصول إلى الدردشات المشتركة. ولكن كما يشير تقرير فوربس، ليس هناك ما يضمن منع محركات البحث من فهرسة صفحات ويب معينة.
حتى لو لم يعمل ملف robots.txt دائمًا على منع فهرسة الصفحات في محركات البحث، فإن مختبرات الذكاء الاصطناعي لا تزال تستخدمه لأغراض أخرى. تعد العديد من المختبرات منشئي المحتوى بأن مواقعهم الإلكترونية لن تُستخدم كعلف تدريبي للذكاء الاصطناعي طالما أن المطورين يتأكدون من “عدم السماح” لبعض برامج الزحف في ملفات robots.txt الخاصة بهم، وتأخذ المختبرات نفسها بهذه النصيحة أيضًا.
