صفحه نخست

آناتک

آنامدیا

دانشگاه

فرهنگ‌

علم

سیاست و جهان

اقتصاد

ورزش

عکس

فیلم

استانها

بازار

اردبیل

آذربایجان شرقی

آذربایجان غربی

اصفهان

البرز

ایلام

بوشهر

تهران

چهارمحال و بختیاری

خراسان جنوبی

خراسان رضوی

خراسان شمالی

خوزستان

زنجان

سمنان

سیستان و بلوچستان

فارس

قزوین

قم

کردستان

کرمان

کرمانشاه

کهگیلویه و بویراحمد

گلستان

گیلان

لرستان

مازندران

مرکزی

همدان

هرمزگان

یزد

پخش زنده

۱۶:۴۶ | ۱۲ / ۰۷ /۱۴۰۵
| |

پژوهشگران ۱۳ هزار نشانه تازه برای شناسایی متن هوش مصنوعی پیدا کردند

بررسی تازه شرکت Graphite حدود ۱۳ هزار واژه و عبارت را شناسایی کرده که در متن‌های تولیدشده با هوش مصنوعی بسیار بیشتر از نوشته‌های انسانی ظاهر می‌شوند و می‌توانند سرنخی برای تشخیص منشأ متن باشند. نتایج همچنین حاکی از آن است که این نشانه‌ها ثابت نیستند و دست‌کم در مورد مدل کلود اوپوس ۵.۵، سبک نوشتار به‌مرور به متن انسانی نزدیک‌تر شده است.
کد خبر : 1087590

به گزارش خبرگزاری آنا؛ تشخیص متن تولیدشده با هوش مصنوعی مدت‌هاست به صنعتی جداگانه تبدیل شده و سرویس‌های متعددی تلاش می‌کنند با بررسی انتخاب واژه، ساختار جمله و الگو‌های آماری مشخص کنند یک متن را انسان نوشته یا مدل زبانی. نشانه‌هایی مانند استفاده بیش از اندازه از خط تیره بلند یا بعضی عبارت‌های رسمی پیش‌تر بار‌ها به‌عنوان سرنخ مطرح شده بودند، اما بررسی تازه Graphite مجموعه بسیار گسترده‌تری از این الگو‌ها را پیدا کرده است. البته Graphite یک شرکت بازاریابی است و نتایج آن باید با همین ملاحظه خوانده شود، اما داده‌های منتشرشده تفاوت‌های جالبی میان سبک نوشتاری مدل‌های مختلف نشان می‌دهند.

عبارت This matters به یکی از واضح‌ترین نشانه‌ها تبدیل شده است

بر اساس این بررسی، عبارت انگلیسی This matters که می‌توان آن را «این موضوع اهمیت دارد» ترجمه کرد، در متن‌های تولیدشده با هوش مصنوعی ۱۱۶ برابر بیشتر از نمونه‌های انسانی مورد مقایسه دیده شده است. این الگو به‌ویژه در خروجی کلود اوپوس ۵.۵ مشاهده می‌شود و Graphite آن را یکی از برجسته‌ترین نشانه‌های فعلی این مدل معرفی کرده است.

کلود همچنین عبارت looking ahead the را حدود ۴۰ برابر بیشتر از متن‌های انسانی به کار می‌برد و ساختار why ... matters در خروجی آن ۹۲ برابر رایج‌تر گزارش شده است. واژه dependable نیز حدود ۲۶ برابر بیشتر از نمونه‌های انسانی دیده شده است. این تفاوت‌ها به این معنی نیست که وجود یکی از این عبارت‌ها به‌تنهایی ثابت می‌کند متن را هوش مصنوعی نوشته، بلکه نشان می‌دهد مدل‌ها هنگام تولید حجم زیادی از متن ممکن است ناخودآگاه به بعضی ترکیب‌های زبانی بیشتر از نویسندگان انسانی تکیه کنند.

هر مدل عادت‌های نوشتاری خودش را دارد

بررسی Graphite همچنین تفاوت قابل توجهی میان کلود اوپوس ۵.۵ و مدل آسترا اوپن‌ای‌آی پیدا کرده است. آسترا برای مثال عبارت does not establish را با فراوانی بسیار بالایی به کار می‌برد و طبق این مطالعه، این عبارت در متن‌های آسترا حدود ۲۷۵ برابر بیشتر از خروجی کلود دیده می‌شود. پژوهش همچنین نتیجه گرفته که اوپوس ۵.۵ نسبت به آسترا کمتر از عبارت‌هایی استفاده می‌کند که ادعا‌ها را محتاطانه و مشروط بیان می‌کنند و در مقابل تمایل بیشتری به استفاده از صفت‌ها و ساختار‌های برتری دارد.

این تفاوت نشان می‌دهد صحبت از یک سبک واحد برای تمام متن‌های هوش مصنوعی چندان دقیق نیست. همان‌طور که نویسندگان انسانی عادت‌های زبانی متفاوتی دارند، مدل‌ها نیز بسته به داده‌های آموزشی، شیوه تنظیم و طراحی خود به ترکیب‌های مشخصی گرایش پیدا می‌کنند. در نتیجه ابزاری که تنها به چند نشانه مشهور مانند نوع نشانه‌گذاری یا چند عبارت خاص تکیه کند، ممکن است با تغییر مدل یا حتی نسخه جدید همان مدل به‌سرعت دقت خود را از دست بدهد.

کلود بعضی از نشانه‌های قدیمی خود را کنار گذاشته است

یکی از نتایج جالب مطالعه به مقایسه نسل‌های مختلف کلود مربوط می‌شود. اوپوس ۵.۵ نسبت به اوپوس ۵ حدود ۹۹ درصد کمتر از خط تیره بلند یا em dash استفاده می‌کند؛ نشانه‌ای که طی سال‌های اخیر آن‌قدر با متن تولیدشده توسط هوش مصنوعی پیوند خورده بود که گاهی وجود چند نمونه از آن در یک نوشته برای ایجاد سوءظن کافی بود.

کاهش شدید استفاده از این علامت می‌تواند به این معنی باشد که سبک خروجی مدل در نسخه جدید تغییر کرده و برخی از نشانه‌های قبلی کم‌رنگ شده‌اند. با این حال، حذف یک عادت لزوماً متن هوش مصنوعی را بدون نشانه نمی‌کند و Graphite معتقد است هم‌زمان با ناپدید شدن بعضی الگوها، موارد تازه‌ای ظاهر می‌شوند. به همین دلیل شناسایی متن هوش مصنوعی بیشتر شبیه دنبال کردن هدفی متحرک است تا ساخت فهرستی ثابت از کلمات ممنوعه.

تشخیص متن هوش مصنوعی سخت‌تر می‌شود

روند کلی گزارش برای کلود این است که خروجی مدل به مرور شباهت بیشتری به نوشته‌های معمول انسانی پیدا می‌کند. این موضوع کار ابزار‌های تشخیص را دشوارتر می‌کند، زیرا بسیاری از آنها بر تفاوت‌های آماری میان متن انسانی و ماشینی تکیه دارند و هرچه این فاصله کمتر شود، احتمال خطای تشخیص نیز افزایش پیدا می‌کند.

آسترا در داده‌های همین مطالعه مسیر متفاوتی داشته و نوشته‌های آن در برخی شاخص‌ها از متن انسانی فاصله بیشتری گرفته‌اند. نتیجه مهم این است که هیچ نشانه واحدی مانند خط تیره بلند، یک عبارت خاص یا نوع مشخصی از جمله‌بندی نمی‌تواند به‌تنهایی معیار قابل اتکایی برای تشخیص نویسنده باشد. حتی فهرستی شامل هزاران الگو نیز با تغییر نسل مدل‌ها می‌تواند به‌سرعت بخشی از اعتبار خود را از دست بدهد.

این بررسی بیش از آنکه راهی قطعی برای شناسایی متن هوش مصنوعی ارائه کند، نشان می‌دهد مدل‌های زبانی نیز نوعی عادت نوشتاری آماری پیدا می‌کنند. بعضی از این عادت‌ها در یک نسخه بسیار واضح‌اند و چند ماه بعد تقریباً ناپدید می‌شوند، در حالی که الگو‌های تازه جای آنها را می‌گیرند؛ بنابراین با طبیعی‌تر شدن خروجی مدل‌ها، تشخیص متن ماشینی احتمالاً کمتر به پیدا کردن یک کلمه یا علامت مشخص و بیشتر به بررسی مجموعه‌ای از الگو‌های زبانی وابسته خواهد شد.

ارسال نظر
captcha