پژوهشگران ۱۳ هزار نشانه تازه برای شناسایی متن هوش مصنوعی پیدا کردند
به گزارش خبرگزاری آنا؛ تشخیص متن تولیدشده با هوش مصنوعی مدتهاست به صنعتی جداگانه تبدیل شده و سرویسهای متعددی تلاش میکنند با بررسی انتخاب واژه، ساختار جمله و الگوهای آماری مشخص کنند یک متن را انسان نوشته یا مدل زبانی. نشانههایی مانند استفاده بیش از اندازه از خط تیره بلند یا بعضی عبارتهای رسمی پیشتر بارها بهعنوان سرنخ مطرح شده بودند، اما بررسی تازه Graphite مجموعه بسیار گستردهتری از این الگوها را پیدا کرده است. البته Graphite یک شرکت بازاریابی است و نتایج آن باید با همین ملاحظه خوانده شود، اما دادههای منتشرشده تفاوتهای جالبی میان سبک نوشتاری مدلهای مختلف نشان میدهند.
عبارت This matters به یکی از واضحترین نشانهها تبدیل شده است
بر اساس این بررسی، عبارت انگلیسی This matters که میتوان آن را «این موضوع اهمیت دارد» ترجمه کرد، در متنهای تولیدشده با هوش مصنوعی ۱۱۶ برابر بیشتر از نمونههای انسانی مورد مقایسه دیده شده است. این الگو بهویژه در خروجی کلود اوپوس ۵.۵ مشاهده میشود و Graphite آن را یکی از برجستهترین نشانههای فعلی این مدل معرفی کرده است.
کلود همچنین عبارت looking ahead the را حدود ۴۰ برابر بیشتر از متنهای انسانی به کار میبرد و ساختار why ... matters در خروجی آن ۹۲ برابر رایجتر گزارش شده است. واژه dependable نیز حدود ۲۶ برابر بیشتر از نمونههای انسانی دیده شده است. این تفاوتها به این معنی نیست که وجود یکی از این عبارتها بهتنهایی ثابت میکند متن را هوش مصنوعی نوشته، بلکه نشان میدهد مدلها هنگام تولید حجم زیادی از متن ممکن است ناخودآگاه به بعضی ترکیبهای زبانی بیشتر از نویسندگان انسانی تکیه کنند.
هر مدل عادتهای نوشتاری خودش را دارد
بررسی Graphite همچنین تفاوت قابل توجهی میان کلود اوپوس ۵.۵ و مدل آسترا اوپنایآی پیدا کرده است. آسترا برای مثال عبارت does not establish را با فراوانی بسیار بالایی به کار میبرد و طبق این مطالعه، این عبارت در متنهای آسترا حدود ۲۷۵ برابر بیشتر از خروجی کلود دیده میشود. پژوهش همچنین نتیجه گرفته که اوپوس ۵.۵ نسبت به آسترا کمتر از عبارتهایی استفاده میکند که ادعاها را محتاطانه و مشروط بیان میکنند و در مقابل تمایل بیشتری به استفاده از صفتها و ساختارهای برتری دارد.
این تفاوت نشان میدهد صحبت از یک سبک واحد برای تمام متنهای هوش مصنوعی چندان دقیق نیست. همانطور که نویسندگان انسانی عادتهای زبانی متفاوتی دارند، مدلها نیز بسته به دادههای آموزشی، شیوه تنظیم و طراحی خود به ترکیبهای مشخصی گرایش پیدا میکنند. در نتیجه ابزاری که تنها به چند نشانه مشهور مانند نوع نشانهگذاری یا چند عبارت خاص تکیه کند، ممکن است با تغییر مدل یا حتی نسخه جدید همان مدل بهسرعت دقت خود را از دست بدهد.
کلود بعضی از نشانههای قدیمی خود را کنار گذاشته است
یکی از نتایج جالب مطالعه به مقایسه نسلهای مختلف کلود مربوط میشود. اوپوس ۵.۵ نسبت به اوپوس ۵ حدود ۹۹ درصد کمتر از خط تیره بلند یا em dash استفاده میکند؛ نشانهای که طی سالهای اخیر آنقدر با متن تولیدشده توسط هوش مصنوعی پیوند خورده بود که گاهی وجود چند نمونه از آن در یک نوشته برای ایجاد سوءظن کافی بود.
کاهش شدید استفاده از این علامت میتواند به این معنی باشد که سبک خروجی مدل در نسخه جدید تغییر کرده و برخی از نشانههای قبلی کمرنگ شدهاند. با این حال، حذف یک عادت لزوماً متن هوش مصنوعی را بدون نشانه نمیکند و Graphite معتقد است همزمان با ناپدید شدن بعضی الگوها، موارد تازهای ظاهر میشوند. به همین دلیل شناسایی متن هوش مصنوعی بیشتر شبیه دنبال کردن هدفی متحرک است تا ساخت فهرستی ثابت از کلمات ممنوعه.
تشخیص متن هوش مصنوعی سختتر میشود
روند کلی گزارش برای کلود این است که خروجی مدل به مرور شباهت بیشتری به نوشتههای معمول انسانی پیدا میکند. این موضوع کار ابزارهای تشخیص را دشوارتر میکند، زیرا بسیاری از آنها بر تفاوتهای آماری میان متن انسانی و ماشینی تکیه دارند و هرچه این فاصله کمتر شود، احتمال خطای تشخیص نیز افزایش پیدا میکند.
آسترا در دادههای همین مطالعه مسیر متفاوتی داشته و نوشتههای آن در برخی شاخصها از متن انسانی فاصله بیشتری گرفتهاند. نتیجه مهم این است که هیچ نشانه واحدی مانند خط تیره بلند، یک عبارت خاص یا نوع مشخصی از جملهبندی نمیتواند بهتنهایی معیار قابل اتکایی برای تشخیص نویسنده باشد. حتی فهرستی شامل هزاران الگو نیز با تغییر نسل مدلها میتواند بهسرعت بخشی از اعتبار خود را از دست بدهد.
این بررسی بیش از آنکه راهی قطعی برای شناسایی متن هوش مصنوعی ارائه کند، نشان میدهد مدلهای زبانی نیز نوعی عادت نوشتاری آماری پیدا میکنند. بعضی از این عادتها در یک نسخه بسیار واضحاند و چند ماه بعد تقریباً ناپدید میشوند، در حالی که الگوهای تازه جای آنها را میگیرند؛ بنابراین با طبیعیتر شدن خروجی مدلها، تشخیص متن ماشینی احتمالاً کمتر به پیدا کردن یک کلمه یا علامت مشخص و بیشتر به بررسی مجموعهای از الگوهای زبانی وابسته خواهد شد.
انتهای پیام/