کوالکام جزئیات NPU جدید اسنپدراگون ۸ الیت نسل ۶ پرو را اعلام کرد
به گزارش خبرگزاری آنا؛ کوالکام قرار است اسنپدراگون ۸ الیت نسل ۶ و نسخه پرو آن را در ۳۱ شهریور در اجلاس سالانه اسنپدراگون معرفی کند، اما پیش از این مراسم بخشی از معماری هوش مصنوعی تراشه قدرتمندتر را توضیح داده است. NPU هگزاگون جدید برای سناریوهایی طراحی شده که یک ایجنت باید همزمان زمینه طولانیتری را نگه دارد، از چند ابزار استفاده کند و چند وظیفه را بدون توقف پیش ببرد؛ به همین دلیل کوالکام حافظه مشترک این بخش را ۵۰ درصد افزایش داده تا دادههای پرکاربرد مدل نزدیکتر به NPU باقی بمانند و رفتوآمد مداوم به حافظه اصلی کمتر شود.
شتابدهنده جدید برای مدلهای ترنسفورمر ساخته شده است
یکی از تغییرات اصلی، اضافه شدن Element Accelerator است؛ شتابدهندهای که مشخصاً برای بارهای پردازشی ترنسفورمرها طراحی شده است. این بخش در کنار واحدهای اسکالر، برداری و ماتریسی، عملیات سنگینی را که مدلهای مولد و ایجنتی بیشتر به آنها وابستهاند سریعتر انجام میدهد تا مدل بتواند پاسخ را زودتر تولید کند و مراحل استدلال را با مصرف انرژی مناسبتری روی خود دستگاه پیش ببرد.
هدف اصلی این طراحی، کاهش گلوگاههایی است که هنگام اجرای مدلهای بزرگ روی گوشی ایجاد میشوند. وقتی یک ایجنت باید تاریخچه طولانی مکالمه، چند ابزار و چند وظیفه فعال را همزمان مدیریت کند، انتقال مداوم داده میان حافظه و NPU میتواند سرعت پاسخگویی را پایین بیاورد. حافظه مشترک بزرگتر و شتابدهنده جدید قرار است بخش بیشتری از این اطلاعات را نزدیک واحد پردازش هوش مصنوعی نگه دارند و زمان انتظار را کاهش دهند.
مدلهای INT۴ سریعتر آماده پاسخ میشوند
کوالکام اعلام کرده NPU جدید در مرحله Prefill مدلهای INT۴ تا ۵۰ درصد سریعتر است. Prefill همان مرحلهای است که مدل پیش از شروع تولید پاسخ، ورودی کاربر و زمینه موجود را پردازش میکند؛ بنابراین افزایش سرعت آن میتواند بهویژه در درخواستهای طولانی یا زمانی که مدل باید مقدار زیادی متن و داده را بررسی کند، تأخیر اولیه را کاهش دهد.
استفاده از INT۴ نیز به اجرای مدلها با دقت عددی پایینتر و مصرف حافظه کمتر کمک میکند. چنین روشی برای گوشیهای هوشمند اهمیت زیادی دارد، زیرا مدل باید در فضایی محدودتر از سرورهای ابری اجرا شود و همزمان مصرف انرژی و گرمای دستگاه نیز کنترل شود.
معماری جدید برای مدلهای Mixture-of-Experts هم مناسب است
هگزاگون جدید برای مدلهای Mixture-of-Experts یا MoE نیز بهینه شده است؛ معماریای که در آن همه پارامترهای مدل برای هر توکن فعال نمیشوند و فقط بخش کوچکی از «متخصصها» در هر مرحله وارد محاسبه میشوند. این روش میتواند امکان استفاده از مدلهای بزرگتر را فراهم کند بدون اینکه تمام ظرفیت آنها در هر درخواست مصرف شود.
کوالکام میگوید معماری تازه برای هوش مصنوعی همیشهفعال، استدلال با زمینه طولانی، مدلهای چندوجهی، اجرای چند ایجنت بهصورت همزمان و چرخههای عملیاتی با تأخیر پایین طراحی شده است. در عمل، این یعنی نسل بعدی گوشیهای پرچمدار مجهز به اسنپدراگون میتوانند بخش بیشتری از وظایف هوش مصنوعی را مستقیماً روی دستگاه انجام دهند؛ از پردازش متن و تصویر گرفته تا اجرای ایجنتهایی که باید چند مرحله متوالی را بدون اتکا دائمی به فضای ابری انجام دهند.
تمرکز نسل جدید فقط روی افزایش قدرت خام نیست
اطلاعاتی که تاکنون منتشر شده بیشتر از افزایش ساده توان محاسباتی روی نحوه اجرای مدلهای جدید تمرکز دارد. حافظه بزرگتر، کاهش زمان Prefill و پشتیبانی بهتر از معماریهای ترنسفورمر و MoE مستقیماً به نوع مدلهایی مربوط میشوند که اکنون در دستیارهای هوشمند و ایجنتهای شخصی استفاده میشوند.
کوالکام هنوز همه جزئیات عملکردی NPU یا میزان دقیق بهبود آن نسبت به نسل قبل را اعلام نکرده است. مشخصات کامل اسنپدراگون ۸ الیت نسل ۶ پرو همراه با نسخه استاندارد این خانواده در ۳۱ شهریور منتشر خواهد شد و آن زمان میتوان مشخصتر دید این تغییرات در اجرای واقعی مدلهای هوش مصنوعی روی گوشی چه تأثیری خواهند داشت.
انتهای پیام/