بنچمارکها از عملکرد قدرتمند هوش مصنوعی جدید علیبابا در توسعه نرمافزار حکایت دارند
به گزارش خبرگزاری آنا؛ علیبابا جدیدترین مدل هوش مصنوعی خود با نام کوئن ۳.۸ ۲۷B را در پلتفرم هاگینگ فیس در دسترس عموم قرار داده است. این مدل متراکم چندوجهی علاوه بر قابلیت درک بومی تصویر و ویدئو، از پنجره زمینه ۲۶۲ هزار و ۱۴۴ توکنی و قابلیت تنظیم میزان استدلال برخوردار است و مهمتر از همه، به دلیل اندازه نسبتاً بهینه خود میتواند بهصورت محلی روی طیف گستردهای از سختافزارهای قدرتمند اجرا شود؛ موضوعی که برای توسعهدهندگانی که به دنبال کاهش وابستگی به سرویسهای ابری هستند اهمیت زیادی دارد.
اجرای مدل روی رایانههای شخصی با کوانتیزاسیون
اجرای کوئن ۳.۸ ۲۷B با دقت ۱۶ بیتی به حدود ۵۶ گیگابایت حافظه گرافیکی (VRAM) نیاز دارد، در حالی که نسخه FP۸ آن با حدود ۲۸ گیگابایت حافظه قابل اجرا است. با این حال، استفاده از روش کوانتیزاسیون ۴ بیتی میتواند حجم مورد نیاز مدل را به حدود ۱۷ گیگابایت کاهش دهد و امکان اجرای آن را روی سیستمهای شخصی مجهز به کارتهای گرافیک قدرتمند فراهم کند. این ویژگی باعث میشود کاربران بتوانند بخشی از وظایف پیچیده برنامهنویسی، تحلیل و کار با عاملهای هوش مصنوعی را بدون اتصال دائمی به اینترنت یا ارسال اطلاعات به زیرساختهای ابری انجام دهند. چنین قابلیتی بهویژه برای سازمانهایی که با دادههای حساس کار میکنند اهمیت دارد، زیرا اطلاعات مورد استفاده مدل میتواند در همان دستگاه باقی بماند و علاوه بر افزایش کنترل بر دادهها، هزینه استفاده مداوم از APIهای ابری نیز کاهش پیدا کند.
البته اجرای محلی این مدل همچنان به سختافزار مناسب نیاز دارد و تفاوت میان نسخههای مختلف کوانتیزهشده میتواند روی سرعت، مصرف حافظه و کیفیت خروجی اثر بگذارد؛ بنابراین استفاده از آن روی رایانههای معمولی برای همه کاربران لزوماً تجربهای مشابه اجرای مدل روی زیرساختهای قدرتمند دیتاسنتری ایجاد نخواهد کرد.
عملکرد قابلتوجه در برنامهنویسی و وظایف عاملی
دادههای اولیه منتشرشده از عملکرد کوئن ۳.۸ ۲۷B نشان میدهد علیبابا تمرکز ویژهای بر قابلیتهای مهندسی نرمافزار و اجرای وظایف پیچیده داشته است. این مدل در بنچمارک SWE-bench Pro برای برنامهنویسی خودکار امتیاز ۶۱.۷ و در LiveCodeBench v۶ امتیاز ۹۰.۳ را به دست آورده است؛ ارقامی که نشان میدهند مدل تنها برای پاسخگویی متنی ساده طراحی نشده و میتواند در حل مسائل واقعی کدنویسی نیز مورد استفاده قرار گیرد.
ارزیابیهای مستقل Artificial Analysis نیز تصویری مشابه ارائه میکنند. کوئن ۳.۸ ۲۷B در شاخص هوش ترکیبی این مؤسسه امتیاز ۵۲ را ثبت کرده است؛ عملکردی که در برخی مقایسهها با مدلهای ابری پیشرفته در حالت استدلال حداکثری برابری میکند. این مدل همچنین در شاخص مربوط به وظایف عاملی امتیاز ۵۱ به دست آورده است که نشاندهنده تمرکز آن بر اجرای زنجیرهای از وظایف و تعامل با ابزارهای مختلف است.
اهمیت این نتایج در کنار قابلیت اجرای محلی مدل بیشتر میشود؛ زیرا توسعهدهندگان میتوانند از یک مدل نسبتاً بزرگ برای ساخت ابزارهای برنامهنویسی، دستیارهای خودکار و عاملهای نرمافزاری استفاده کنند، بدون اینکه برای هر درخواست الزاماً به یک سرویس پردازشی ابری وابسته باشند.
«تفکر بیش از حد»؛ چالشی برای سرعت پاسخگویی
با وجود تواناییهای فنی، یکی از چالشهای کوئن ۳.۸ ۲۷B در تنظیمات پیشفرض، تمایل آن به «تفکر بیش از حد» است. در برخی آزمایشها، فعال کردن بالاترین سطح استدلال یا حالت xhigh reasoning باعث شده مدل برای درخواستهایی که پیچیدگی چندانی ندارند، هزاران توکن محاسباتی مصرف کند و پاسخ را پس از چند دقیقه ارائه دهد. به همین دلیل، برای کارهای روزمره و درخواستهایی که به استدلال عمیق نیاز ندارند، توصیه میشود سطح استدلال مدل کاهش پیدا کند یا در صورت امکان غیرفعال شود. این تنظیم میتواند زمان پاسخگویی و مصرف منابع سختافزاری را کاهش دهد و مدل را برای استفادههای روزمره مناسبتر کند.
در کنار این موضوع، پشتیبانی از فناوری «پیشبینی چندتوکنی» در ابزارهای اجرای محلی مانند llama.cpp میتواند سرعت تولید خروجی را افزایش دهد. بر اساس ارزیابیهای منتشرشده، استفاده از این قابلیت در برخی شرایط میتواند سرعت تولید متن را بیش از ۷۰ درصد افزایش دهد و تجربه اجرای مدل روی رایانه شخصی را روانتر کند.
استقبال گسترده از مدل جدید
انتشار کوئن ۳.۸ ۲۷B در حالی انجام شده که علاقه توسعهدهندگان به مدلهای متنباز و قابل اجرای محلی در ماههای اخیر افزایش یافته است. چنین مدلهایی به کاربران اجازه میدهند کنترل بیشتری روی نحوه اجرای هوش مصنوعی، دادههای مورد استفاده و هزینه پردازش داشته باشند و در عین حال، امکان سفارشیسازی مدل برای نیازهای خاص را فراهم میکنند.
استقبال از مدل جدید علیبابا نیز قابل توجه بوده است؛ بهطوری که طبق آمار منتشرشده، تعداد دانلودهای کوئن ۳.۸ ۲۷B در هاگینگ فیس تنها طی سه روز نخست از مرز ۳ میلیون بار عبور کرده است. این میزان استقبال نشان میدهد اجرای مدلهای قدرتمند روی سختافزار شخصی به یکی از مسیرهای مهم رقابت میان شرکتهای توسعهدهنده هوش مصنوعی تبدیل شده است؛ مسیری که میتواند در آینده وابستگی توسعهدهندگان به مدلهای کاملاً ابری را کاهش دهد.
انتهای پیام/