آخرین اخبار:
14:38 29 / 06 /1405

مدل Jev به جای چت کردن، برای نرم‌افزارها در چند صد میلی‌ثانیه تصمیم می‌گیرد

پردازش متن هوش مصنوعی
استارتاپ تایپ‌سیف پس از ۲ سال فعالیت در سکوت خبری از مدل Jev رونمایی کرده که برخلاف چت‌بات‌های مرسوم متن تولید نمی‌کند و مستقیماً تصمیم‌های ساختاریافته و قابل استفاده در کد تحویل می‌دهد. شرکت سازنده مدعی است این مدل در وظایف مناسب خود بین ۴۰ تا ۲۰۰ برابر سریع‌تر از مدل‌های زبانی پرچمدار عمل می‌کند و هر پاسخ را همراه با احتمال و میزان اطمینان ارائه می‌دهد تا نرم‌افزار بتواند درباره اجرای خودکار یک کار یا ارجاع آن به انسان تصمیم بگیرد.

به گزارش خبرگزاری آنا؛ تایپ‌سیف AI را دیوگو آلمیدا، پژوهشگر سابق اوپن‌ای‌آی، تأسیس کرده که در توسعه روش‌های آموزش مدل‌های دستورپذیر و پژوهش‌های منتهی به چت‌جی‌پی‌تی نقش داشته است. وی اکنون Jev را نخستین محصول از دسته‌ای با عنوان «مدل‌های سیستم یک» معرفی می‌کند که به جای گفت‌و‌گو با انسان، برای قرار گرفتن مستقیم در دل نرم‌افزار ساخته شده‌اند. ورودی مدل می‌تواند مجموعه‌ای از اطلاعات نامنظم مانند متن و وضعیت فعلی یک برنامه باشد، اما خروجی از قبل تعریف می‌شود و مثلاً می‌تواند پاسخ بله یا خیر، انتخاب یکی از چند گزینه مشخص یا یک امتیاز احتمالی باشد.

«سیستم یک» یعنی چه؟

نام این معماری از تقسیم‌بندی مشهور دنیل کانمن میان «سیستم ۱» و «سیستم ۲» الهام گرفته شده است. سیستم ۱ در این چارچوب به تصمیم‌گیری سریع و خودکار اشاره دارد، در حالی که سیستم ۲ برای تفکر آهسته‌تر و تحلیلی‌تر به کار می‌رود. تایپ‌سیف از همین تشبیه برای توضیح Jev استفاده می‌کند و هدفش ساخت مدلی نیست که مانند یک چت‌بات چند پاراگراف استدلال تولید کند، بلکه می‌خواهد پاسخ‌هایی سریع برای نقاط تصمیم‌گیری داخل برنامه‌ها فراهم کند. این نام‌گذاری بیشتر یک الهام مفهومی است و نباید آن را به معنای معادل دقیق مدل‌های استدلالی امروزی با «سیستم ۲» مغز انسان دانست.

مدل‌های زبانی معمولاً پاسخ را کلمه‌به‌کلمه و به‌صورت ترتیبی تولید می‌کنند، اما Jev تولید متن آزاد را کنار گذاشته و چند خروجی موردنیاز را به‌صورت موازی محاسبه می‌کند. برای نمونه یک سامانه پشتیبانی می‌تواند متن پیام مشتری را در اختیار مدل قرار دهد و از آن بخواهد مشخص کند درخواست مربوط به امور مالی، مشکل فنی یا ارسال کالا است، میزان فوریت آن چقدر است و آیا احتمال سوءاستفاده وجود دارد. همه گزینه‌های مجاز از قبل در کد تعریف می‌شوند و Jev نمی‌تواند ناگهان پاسخ متفاوتی خارج از همان ساختار بسازد.

برای درک ساده‌تر تفاوت می‌توان Jev را به کارمندی تشبیه کرد که قرار نیست درباره یک مسئله گزارش بنویسد و فقط باید در هر مرحله یکی از چند دکمه مشخص را فشار دهد. بیشتر مدل‌های زبانی برای پاسخ دادن آزادی زیادی دارند و می‌توانند توضیح بدهند، سؤال مطرح کنند یا حتی از قالب مورد انتظار خارج شوند، اما Jev عمداً چنین آزادی‌ای ندارد. نرم‌افزار از قبل مشخص می‌کند چه تصمیم‌هایی مجاز هستند و مدل فقط باید با توجه به اطلاعاتی که دریافت کرده، محتمل‌ترین گزینه را انتخاب کند. همین محدودیت که در یک چت‌بات ضعف محسوب می‌شود، داخل نرم‌افزاری که میلیون‌ها تصمیم تکراری دارد می‌تواند به مزیت تبدیل شود.

خروجی برای کد، نه برای انسان

تفاوت اصلی Jev با قابلیت‌هایی مانند JSON در مدل‌های زبانی این است که ساختار پاسخ صرفاً با دستور به مدل تحمیل نمی‌شود. تایپ‌سیف می‌گوید نوع خروجی جزئی از معماری خود سیستم است و به همین دلیل خطای ساختاری یا بازگرداندن نوع داده اشتباه از نظر طراحی رخ نمی‌دهد. اگر برنامه فقط مقدار درست یا غلط بخواهد، مدل متن توضیحی، نام ابزار خیالی یا داده‌ای خارج از این ۲ گزینه تحویل نمی‌دهد و اگر مجموعه‌ای از شناسه‌های مشخص تعریف شده باشد، انتخاب نیز به همان گزینه‌ها محدود می‌شود.

همین نکته پشت ادعای «بدون توهم» تایپ‌سیف قرار دارد، اما باید میان توهم ساختاری و پاسخ نادرست تفاوت گذاشت. Jev همچنان ممکن است درباره ماهیت یک پیام، خطر یک تراکنش یا دسته مناسب یک درخواست تصمیم اشتباه بگیرد. تفاوت این است که مدل همراه تصمیم خود احتمال و میزان اطمینان ارائه می‌کند تا توسعه‌دهنده مثلاً تعیین کند پاسخ‌های با اطمینان بالاتر از ۹۵ درصد به‌طور خودکار اجرا شوند و موارد نامطمئن برای بررسی انسانی فرستاده شوند. خود تایپ‌سیف نیز در توضیحاتش می‌پذیرد که Jev می‌تواند اشتباه کند و هدف از کالیبره کردن احتمالات، قابل مدیریت کردن همین عدم قطعیت است.

تفاوت این رویکرد در عمل زمانی واضح‌تر می‌شود که هوش مصنوعی بخشی از یک زنجیره خودکار باشد. فرض کنید فروشگاهی روزانه هزاران درخواست مشتری دریافت می‌کند و برای هر پیام باید تصمیم بگیرد درخواست به کدام واحد فرستاده شود، آیا نیاز به رسیدگی فوری دارد و احتمال تقلب چقدر است. استفاده از یک چت‌بات معمولی برای چنین کاری به این معناست که برنامه ابتدا پاسخ متنی مدل را دریافت و سپس آن را دوباره تفسیر و کنترل کند. Jev تلاش می‌کند همین مرحله میانی را حذف کند و تصمیم را مستقیماً در قالبی تحویل دهد که برنامه بتواند بدون تبدیل متن به داده از آن استفاده کند. در نتیجه ارزش اصلی مدل نه در توانایی صحبت کردن، بلکه در این است که تا حد ممکن شبیه یکی از اجزای عادی خود نرم‌افزار رفتار کند.

چرا نام این مدل Jev است؟

نام Jev از ویلیام استنلی جونز، اقتصاددان انگلیسی قرن نوزدهم، گرفته شده که بیشتر با «پارادوکس جونز» شناخته می‌شود. این ایده می‌گوید افزایش بهره‌وری یک فناوری همیشه به کاهش مصرف منجر نمی‌شود و حتی ممکن است استفاده از آن را بیشتر کند. تایپ‌سیف همین منطق را به هوش مصنوعی تعمیم داده و روی این فرض حساب می‌کند که ارزان‌تر و سریع‌تر شدن پردازش مدل‌ها در نهایت به اجرای تعداد بسیار بیشتری درخواست منجر خواهد شد. به بیان ساده‌تر، هدف Jev این نیست که هر بار یک پاسخ طولانی و پرهزینه تولید کند، بلکه قرار است آن‌قدر سبک و سریع باشد که بتوان آن را بار‌ها و بار‌ها در پشت صحنه نرم‌افزار فراخوانی کرد.

نوع کار این مدل را می‌توان در نمونه بازی Doom هم دید. Jev تصویر بازی را مستقیماً تماشا نمی‌کند و به جای آن اطلاعات ساختاریافته‌ای درباره وضعیت بازی دریافت می‌کند و از میان مجموعه‌ای از تصمیم‌های از قبل تعریف‌شده، اقدام بعدی را انتخاب می‌کند. همین منطق در محیط‌های جدی‌تر نیز قابل استفاده است. توسعه‌دهنده می‌تواند وضعیت فعلی را به مدل بدهد و از آن بخواهد میان چند گزینه انتخاب کند، یک مقدار را امتیازدهی کند یا احتمال گزینه‌های مختلف را برگرداند. برای نمونه اگر پیام مشتری درباره دوبار کسر شدن مبلغ کارت باشد، مدل می‌تواند احتمال تعلق آن به بخش مالی، فنی یا فروش را جداگانه محاسبه کند و نرم‌افزار بر اساس همین خروجی مسیر بعدی را تعیین کند.

مدل Jev به جای چت کردن، برای نرم‌افزارها در چند صد میلی‌ثانیه تصمیم می‌گیرد

این رویکرد همچنین روشن می‌کند چرا مقایسه مستقیم ادعای «بدون توهم» Jev با چت‌بات‌ها چندان ساده نیست. مدل قرار نیست نقل‌قول حقوقی جعلی بسازد یا متنی طولانی درباره موضوعی نامعلوم تولید کند، زیرا اساساً چنین نوع خروجی‌ای در اختیارش نیست. محدود بودن ساختار پاسخ احتمال خطای قالبی را از بین می‌برد، اما همچنان ممکن است Jev گزینه اشتباه را با احتمال بالا انتخاب کند؛ بنابراین مزیت اصلی آن بیشتر در کنترل‌پذیری و قابل استفاده بودن مستقیم خروجی برای نرم‌افزار است تا مصونیت کامل در برابر تصمیم اشتباه.

آموزش با RLCD به جای تمرکز بر پاسخ‌های محبوب

تایپ‌سیف برای آموزش این خانواده از روشی به نام «یادگیری تقویتی برای تصمیم‌های کالیبره‌شده» یا RLCD استفاده کرده است. در مدل‌های گفت‌وگومحور، روش‌هایی مانند RLHF تا حد زیادی برای تولید پاسخ‌هایی به کار می‌روند که انسان‌ها مفیدتر و مطلوب‌تر ارزیابی می‌کنند، اما Jev به‌جای کیفیت نگارش یا لحن پاسخ، برای تصمیم همراه با احتمال قابل اتکا بهینه می‌شود. هدف این است که افزایش میزان اطمینان مدل واقعاً با افزایش احتمال درست بودن تصمیم همراه باشد و برنامه بتواند از این عدد برای تعیین آستانه‌های خودکارسازی استفاده کند.

تایپ‌سیف این معماری را برای کار‌هایی مانند مسیریابی درخواست‌ها میان ایجنت‌ها، دسته‌بندی میلیون‌ها پیام، تشخیص تراکنش‌های مشکوک، اولویت‌بندی هشدار‌های امنیتی، امتیازدهی و بررسی خروجی مدل‌های دیگر در نظر گرفته است. Jev همچنین می‌تواند نقش یک «اگرِ هوشمند» را داخل نرم‌افزار ایفا کند، یعنی جایی که نوشتن قوانین ثابت برای تمام حالت‌های ممکن دشوار است، مدل وضعیت را بررسی کند و یکی از مسیر‌های از پیش تعریف‌شده برنامه را انتخاب کند. سرعت پایین‌تر از نیم ثانیه نیز استفاده از آن را در برنامه‌های بلادرنگ عملی‌تر می‌کند.

پاسخ در ۷۰ تا ۵۰۰ میلی‌ثانیه

براساس آزمایش‌های خود تایپ‌سیف، زمان پاسخ Jev بسته به نوع درخواست حدود ۷۰ تا ۵۰۰ میلی‌ثانیه است و شرکت در وظایف موسوم به System One از بهبود سرعتی بین ۴۰ تا ۲۰۰ برابر نسبت به مدل‌های زبانی پرچمدار صحبت می‌کند. تایپ‌سیف در مجموعه دیگری از گردش‌های کاری داخلی عدد ۱۹۳.۶ برابر سرعت بیشتر و ۴۴۴.۶ برابر هزینه کمتر را نیز اعلام کرده، اما خودش تأکید دارد این نتایج در محدوده بالای مزیت‌های احتمالی قرار دارند و ارزیابی‌ها توسط تیم خود شرکت طراحی شده‌اند، بنابراین برای سنجش مستقل توان مدل باید منتظر آزمایش‌های بیرونی گسترده‌تر ماند.

هزینه ورودی Jev نیز ۰.۰۴۲ دلار به ازای هر یک میلیون توکن تعیین شده و تایپ‌سیف فعلاً برای خروجی هزینه جداگانه‌ای دریافت نمی‌کند، زیرا مدل رشته متنی طولانی تولید نمی‌کند. شرکت می‌گوید معماری موازی و حذف تولید کلمه‌به‌کلمه عامل اصلی کاهش زمان و هزینه است. Jev در حال حاضر پنجره زمینه ۳۲ هزار توکنی دارد و علاوه بر دسترسی مستقیم از طریق تایپ‌سیف، نسخه آن در اوپن‌روتر نیز ارائه شده است.

مدلی که قرار نیست جای چت‌بات را بگیرد

Jev برای نوشتن مقاله، پاسخ دادن به سؤال عمومی یا تولید کد و متن آزاد ساخته نشده و کنار گذاشتن همین توانایی یکی از دلایل سرعت بالای آن است. تایپ‌سیف در واقع روی بخشی از بازار تمرکز کرده که مدل قرار نیست مستقیماً با انسان صحبت کند و فقط باید بار‌ها در پشت صحنه یک تصمیم محدود و مشخص بگیرد. در یک فروشگاه اینترنتی این تصمیم می‌تواند تشخیص نوع تیکت باشد و در سامانه مالی، بررسی احتمال تقلب یا تعیین اینکه تراکنش برای بررسی بیشتر متوقف شود.

Jev اکنون در مرحله دسترسی اولیه قرار دارد و بخش زیادی از ادعا‌های مربوط به سرعت، هزینه و کیفیت تصمیم‌های آن هنوز براساس آزمایش‌های خود تایپ‌سیف است. با این حال رویکرد این شرکت تفاوت مشخصی با رقابت رایج بر سر ساخت مدل‌های زبانی بزرگ‌تر دارد و به جای تولید پاسخ طولانی‌تر و استدلال بیشتر، تلاش می‌کند هوش مصنوعی را به قطعه‌ای سریع و قابل پیش‌بینی در داخل کد تبدیل کند.

انتهای پیام/

ارسال نظر