آخرین اخبار:
17:17 02 / 07 /1405

مدل‌های تازه خانواده GPT-۶ هزینه کارهای سنگین برنامه‌نویسی را نصف می‌کنند

برنامه‌نویسی با چت‌جی‌پی‌تی
اوپن‌ای‌آی ۲ مدل GPT-۶ Sol و Luna را با تمرکز بر کاهش هزینه اجرای کار‌های حرفه‌ای، برنامه‌نویسی و ایجنت‌ها عرضه کرده و قیمت استفاده از API هر ۲ را نسبت به قیمت‌های تشویقی نسل GPT-۵.۶ نصف کرده است. Sol برای وظایف پیچیده‌تر طراحی شده، در حالی که Luna با ورودی ۱۰ سنتی به ازای هر یک میلیون توکن گزینه بسیار ارزان‌تری برای پردازش‌های پرتعداد و کار‌های روزمره محسوب می‌شود.

به گزارش خبرگزاری آنا؛ خانواده GPT-۶ اوایل شهریور با مدل آسترا آغاز شد که همچنان قدرتمندترین عضو این نسل است، اما ۲ مدل تازه قرار است بخش بیشتری از قابلیت‌های آن را با هزینه پایین‌تر در اختیار کاربران و توسعه‌دهندگان قرار دهند. اوپن‌ای‌آی می‌گوید از روش‌های آموزشی مشابه آسترا برای توسعه آن‌ها استفاده کرده و پیشرفت‌های این نسل در کار حرفه‌ای، صحت پاسخ، کدنویسی، کنترل رایانه و هم‌ترازی را به رده‌های ارزان‌تر منتقل کرده است. سول برای کار‌هایی در نظر گرفته شده که همچنان به استدلال و اجرای چندمرحله‌ای نیاز دارند، در حالی که لونا بیشتر برای پردازش‌های پرتعداد، استخراج اطلاعات، خلاصه‌سازی و وظایف کوچک‌تر مناسب است.

قیمت API نصف شد

هزینه استاندارد GPT-۶ سول به ازای هر یک میلیون توکن ورودی ۲ دلار و برای خروجی ۱۰ دلار تعیین شده است، در حالی که قیمت‌های تشویقی نسل ۵.۶ به‌ترتیب ۴ و ۲۰ دلار بودند. لونا کاهش مشابهی داشته و اکنون هر یک میلیون توکن ورودی آن ۱۰ سنت و خروجی ۵۰ سنت هزینه دارد. اوپن‌ای‌آی این کاهش را نتیجه بهبود زیرساخت استنتاج و استفاده مؤثرتر از حافظه موقت می‌داند و تأکید می‌کند هدف فقط ارزان‌تر کردن پاسخ‌های کوتاه نیست، بلکه پایین آوردن هزینه ایجنت‌هایی است که ممکن است در یک مأموریت طولانی میلیون‌ها توکن مصرف کنند.

سامانه Prompt Caching نیز در نسل جدید تغییر کرده و اوپن‌ای‌آی از نرخ بالاتر استفاده مجدد از زمینه‌های قبلی و تخفیف ۹۰ درصدی برای خواندن توکن‌های کش‌شده خبر می‌دهد. تغییر سطح استدلال یا فعال و غیرفعال کردن ابزار‌ها نیز دیگر الزاماً حافظه موقت قبلی را از بین نمی‌برد و توسعه‌دهنده می‌تواند محل پایان بخش قابل کش شدن پرامپت را مشخص کند. گیت‌هاب می‌گوید این تغییرات طی ماه‌های گذشته سهم توکن‌هایی را که در میلیارد‌ها درخواست Copilot باید دوباره پردازش شوند بیش از ۵۰ درصد کاهش داده است.

سول برای کار‌های طولانی ایجنتی ساخته شده است

بخش بزرگی از معرفی مدل تازه به اجرای مستقل وظایف حرفه‌ای اختصاص دارد. اوپن‌ای‌آی در AutomationBench که فرایند‌های واقعی کسب‌وکار را در ۴۷ ابزار حوزه‌هایی مانند فروش، بازاریابی، مالی و منابع انسانی آزمایش می‌کند، برای سول در بالاترین سطح استدلال امتیاز ۳۳.۲ درصد و هزینه ۲۷ سنت برای هر مأموریت گزارش کرده است. شرکت می‌گوید این نتیجه از GPT-۶ آسترا در سطح استدلال پایین و کلود اوپوس ۵ در بالاترین تنظیم گزارش‌شده بهتر بوده، هرچند چنین مقایسه‌هایی به تنظیمات مدل‌ها، شیوه اجرای آزمون و قیمت‌گذاری مورد استفاده وابسته هستند و نباید آن‌ها را معادل برتری در تمام کاربرد‌های واقعی دانست.

مدل‌های تازه خانواده GPT-۶ هزینه کارهای سنگین برنامه‌نویسی را نصف می‌کنند

کدنویسی نیز یکی از محور‌های اصلی این نسل است. سول در FrontierCode که تغییرات قابل ادغام در پروژه‌های واقعی را ارزیابی می‌کند نسبت به GPT-۵.۶ پیشرفت کرده و اوپن‌ای‌آی می‌گوید در بعضی تنظیمات می‌تواند با مدل‌های گران‌تر رقابت کند. در DeepSWE نیز سول با حداکثر سطح استدلال امتیاز ۶۸.۸ درصد و لونا ۶۶.۶ درصد را ثبت کرده‌اند. نکته مهم برای شرکت بیش از خود امتیاز، هزینه رسیدن به نتیجه است و معرفی نسل تازه بار‌ها بر این ایده تأکید می‌کند که معیار رقابت ایجنت‌ها به‌تدریج از هوش خام به «کار تکمیل‌شده به ازای هزینه» تغییر می‌کند.

خطاهای اطلاعاتی کمتر شده‌اند

اوپن‌ای‌آی می‌گوید سول در ارزیابی داخلی مبتنی بر مکالمات واقعی که کاربران در آن‌ها خطاهای اطلاعاتی گزارش کرده بودند، تقریباً نصف نسل قبلی اشتباه می‌کند و از نظر قابلیت اعتماد به آسترا نزدیک‌تر شده است. لونا نیز پیشرفت قابل توجهی داشته و در سطح استدلال بالاتر می‌تواند به دقت GPT-۵.۶ سول نزدیک شود، در حالی که هزینه اجرای آن بسیار پایین‌تر است. شرکت تأکید دارد این آزمایش عمداً از مکالمات دشواری تشکیل شده که قبلاً باعث خطا شده‌اند و نرخ‌های گزارش‌شده نباید به‌عنوان میزان معمول اشتباه مدل‌ها در استفاده روزمره تفسیر شوند.

توان کنترل رایانه نیز افزایش یافته است. سول در مجموعه آفلاین OSWorld ۲.۰ با بالاترین سطح استدلال امتیاز ۶۰.۵ درصد را ثبت کرده و برای کار‌هایی طراحی شده که ایجنت باید در برنامه‌های مختلف حرکت کند و مجموعه‌ای از اقدامات را بدون راهنمایی مرحله‌به‌مرحله انجام دهد. لونا نیز با وجود جایگاه ارزان‌تر خود در این بخش نسبت به نسل قبل پیشرفت کرده است، هرچند آسترا همچنان مدل اصلی شرکت برای پیچیده‌ترین وظایف کنترل رایانه باقی می‌ماند.

پاسخ‌ها کوتاه‌تر و مستقیم‌تر می‌شوند

بخشی از تغییرات به نحوه تعامل با کاربر مربوط است. اوپن‌ای‌آی می‌گوید سبک پاسخ‌دهی آسترا را به ۲ مدل تازه منتقل کرده تا پاسخ‌ها وضوح بیشتری داشته باشند، اصطلاحات غیرضروری و جمله‌های نامأنوس کمتر شوند و مدل بدون از دست دادن اطلاعات اصلی، کمتر مطالب واضح را برای کاربر تکرار کند. این تغییر به‌خصوص برای گفت‌و‌گو‌های فنی و برنامه‌نویسی طراحی شده که ایجنت باید به‌روشنی توضیح دهد چه کاری انجام داده، چه چیزی را بررسی کرده و کدام بخش هنوز آزمایش نشده است.

شرکت همچنین می‌گوید هر ۲ مدل در ارزیابی‌های هم‌ترازی نسبت به نسخه‌های ۵.۶ پیشرفت کرده‌اند و از جمله کمتر درباره انجام موفق کاری که در واقع تکمیل نشده ادعای نادرست مطرح می‌کنند. این آزمون‌ها عمداً شرایط دشوار و تحریک‌کننده رفتار نامطلوب را ایجاد می‌کنند و اوپن‌ای‌آی هشدار داده نتایج آن‌ها بیانگر نرخ وقوع چنین رفتار‌هایی در استفاده معمول نیستند.

عرضه از Work و Codex آغاز شد

GPT-۶ سول و لونا از زمان معرفی در ChatGPT Work و Codex برای کاربران اشتراک‌های پلاس، پرو، بیزنس، سازمانی و دانشجویی در دسترس قرار گرفته‌اند و کاربران Free و Go نیز می‌توانند لونا را در برنامه دسکتاپ استفاده کنند. عرضه در Chat اصلی به‌صورت تدریجی انجام می‌شود و توسعه‌دهندگان نیز از طریق API به مدل‌های gpt-۶-sol و gpt-۶-luna دسترسی دارند.

اوپن‌ای‌آی با این ۲ مدل عملاً فاصله میان پرچمدار پرهزینه و پردازش‌های پرتعداد را پر کرده است. آسترا برای مسائلی باقی می‌ماند که حداکثر توان مدل اهمیت دارد، سول برای کار‌های پیچیده‌ای طراحی شده که هزینه اجرای مداوم نیز مهم است و لونا قرار است بخش بزرگی از وظایف پرتعداد را با کسری از هزینه مدل‌های قدرتمندتر انجام دهد؛ ساختاری که نشان می‌دهد رقابت نسل جدید مدل‌های هوش مصنوعی بیش از گذشته بر نسبت توانایی به هزینه متمرکز شده است.

انتهای پیام/

ارسال نظر