20:20 20 / 06 /1405

سونو نخستین مدل هوش مصنوعی موسیقی خود را با همکاری شرکت‌های ضبط منتشر کرد

ولید موسیقی با هوش مصنوعی سونو
سونو مدل تولید موسیقی v۶ را منتشر کرده است که برای نخستین بار با استفاده از داده‌های دارای مجوز شماری از شرکت‌های صنعت موسیقی، از جمله وارنر موزیک، BMG و Believe آموزش دیده است. نسل جدید علاوه بر درک بهتر سبک‌های موسیقی، امکان ویرایش بخش‌های مشخص یک آهنگ با دستور متنی و ساخت موسیقی از روی تصویر، ویدئو یا فایل صوتی را فراهم می‌کند، هرچند همچنان در بازآفرینی نقص‌های طبیعی اجرای انسان ضعف دارد.

به گزارش خبرگزاری آنا؛ مدل v۶ نقطه عطف مهمی برای سونو محسوب می‌شود، زیرا نسل‌های قبلی این سرویس با انتقاد‌ها و اختلاف‌های حقوقی درباره منابع داده آموزشی روبه‌رو بودند. جک برودی از سونو گفته است مدل جدید از ابتدا و با مجموعه داده تازه‌ای آموزش داده شده و داده‌های آموزشی نسل‌های پیشین در آن مورد استفاده قرار نگرفته‌اند. بخشی از این مجموعه شامل محتوای دارای مجوز شرکای صنعت موسیقی و بخشی دیگر شامل داده‌های کاربران است، اما هنوز مشخص نیست تمام داده‌های مورد استفاده در آموزش مدل از منابعی تهیه شده‌اند که وضعیت حقوقی آن‌ها کاملاً روشن است.

صنعت موسیقی برای نخستین بار در آموزش مدل نقش داشته است

سونو طی ماه‌های گذشته با چند شرکت بزرگ و مستقل صنعت موسیقی به توافق رسیده است. وارنر موزیک گروپ، BMG و Believe از جمله مجموعه‌هایی هستند که محتوای دارای مجوز آن‌ها در داده‌های آموزشی v۶ قرار گرفته است. این تغییر در شرایطی اتفاق افتاده که یکی از مهم‌ترین مناقشات پیرامون مولد‌های موسیقی هوش مصنوعی، استفاده از آثار دارای حق نشر برای آموزش مدل‌ها بدون کسب اجازه بوده است.

سونو تأکید دارد v۶ با داده‌هایی متفاوت از نسل‌های قبلی ساخته شده است. این موضوع می‌تواند تلاشی برای ایجاد مدل تجاری پایدارتر و کاهش تنش با ناشران و صاحبان آثار باشد، هرچند شرکت جزئیات دقیقی درباره سهم هر منبع در مجموعه داده آموزشی یا فهرست کامل آثار استفاده‌شده منتشر نکرده است.

v۶ در سه نسخه عرضه می‌شود

نسل تازه سونو برخلاف گذشته تنها یک مدل نیست و در سه نسخه v۶-wild ،v۶ و v۶-mini ارائه می‌شود. نسخه مینی برای همه کاربران به‌صورت رایگان در دسترس خواهد بود و با هدف تولید سریع‌تر و مصرف منابع پردازشی کمتر توسعه یافته است. در مقابل، خروجی‌های آن ساده‌تر هستند و ممکن است نشانه‌های مصنوعی بودن موسیقی در آن‌ها بیشتر دیده شود.

نسخه v۶ مدل اصلی این خانواده محسوب می‌شود و بالاترین تعادل میان کیفیت و کنترل را هدف گرفته است. نسخه v۶-wild نیز قرار است خروجی‌های غیرقابل‌پیش‌بینی‌تر تولید کند و به گفته سونو، برای ایجاد اتفاق‌های خوشایند و نقص‌های طبیعی طراحی شده است؛ یعنی همان اشتباه‌ها و تفاوت‌های ظریفی که می‌توانند اجرای موسیقی انسانی را از یک اجرای بیش از حد دقیق متمایز کنند. با این حال آزمایش اولیه د ورج نشان داده تفاوت میان نسخه wild و v۶ استاندارد همیشه به‌سادگی قابل تشخیص نیست. مدل حتی با دستور‌های مستقیم برای اجرای خارج از کوک یا بی‌نظم، تمایل دارد موسیقی هماهنگ و از نظر ریتم دقیق تولید کند.

شناخت سبک‌های موسیقی بسیار بهتر شده است

یکی از پیشرفت‌های محسوس نسل جدید، درک بهتر ژانر‌های موسیقی است. مدل‌های قدیمی سونو گاهی حتی با دریافت نام مشخص یک سبک، تنها خروجی‌ای تقریباً مشابه آن ایجاد می‌کردند و ویژگی‌های اصلی ژانر را از دست می‌دادند.

v۶ در آزمایش‌های اولیه توانسته نشانه‌های مشخص سبک‌هایی مانند هایپرپاپ یا کراوت‌راک را بهتر بازسازی کند. مدل در سازبندی، ساختار قطعه، نوع ریتم و جنس صدا بهتر تشخیص می‌دهد کاربر هنگام اشاره به یک ژانر مشخص چه ویژگی‌هایی را انتظار دارد. این پیشرفت می‌تواند برای کاربرانی اهمیت داشته باشد که به جای تولید یک قطعه عمومی، موسیقی با هویت سبکی مشخص می‌خواهند. با این حال، شناخت بهتر ویژگی‌های ظاهری یک ژانر الزاماً به معنای توانایی مدل در بازسازی تمام ظرافت‌های هنری یا اجرایی آن نیست.

هوش مصنوعی هنوز نمی‌تواند عمداً «بد» بنوازد

یکی از تناقض‌های جالب v۶ این است که با وجود پیشرفت فنی، همچنان برای بازسازی نقص‌های طبیعی اجرای انسان مشکل دارد. درخواست‌هایی مانند نواختن پیانویی خارج از کوک، اجرای بی‌قاعده بدون توجه به ضرب یا آواز یکنواخت در آزمایش‌ها اغلب نادیده گرفته شده‌اند و مدل دوباره به سمت خروجی منظم و هماهنگ برگشته است.

اجرای انسانی الزاماً از نظر زمان‌بندی، کوک و شدت صدا بی‌نقص نیست و همین تفاوت‌های کوچک گاهی بخش مهمی از شخصیت یک قطعه را شکل می‌دهند. مدل‌های مولد معمولاً از الگو‌های موجود یاد می‌گیرند که چگونه یک موسیقی «درست» به نظر برسد و در نتیجه تولید اشتباه کنترل‌شده می‌تواند برای آن‌ها دشوارتر از ایجاد یک اجرای تمیز باشد. نسخه wild قرار است بخشی از این مشکل را برطرف کند، اما ارزیابی اولیه نشان می‌دهد سونو هنوز به هدف خود در ایجاد نقص‌های طبیعی نرسیده است. برخی آثار مصنوعی در صدای خواننده نیز باقی مانده‌اند و در مواردی حتی برجسته‌تر از نسل پنجم شنیده می‌شوند.

دیگر برای اصلاح یک بخش نیازی به ساخت دوباره کل آهنگ نیست

تغییر مهم‌تر v۶ ممکن است نه در کیفیت صدا، بلکه در نحوه تعامل با مدل باشد. کاربران اکنون می‌توانند داخل یک محیط گفت‌وگومحور درباره قسمت مشخصی از آهنگ دستور بدهند و همان بخش را تغییر دهند. برای مثال، اگر کاربر تنها از خط گیتار یک قسمت راضی نباشد یا بخواهد یک مصرع را عوض کند، دیگر لازم نیست کل قطعه از ابتدا تولید شود. مدل می‌تواند عنصر موردنظر را تغییر دهد و بخش‌های دیگر آهنگ را تا حد امکان حفظ کند. این رویکرد، تولید موسیقی با سونو را از یک فرایند مبتنی بر «ساخت دوباره و انتخاب بهترین نتیجه» به ویرایش مرحله‌به‌مرحله نزدیک‌تر می‌کند.

v۶ همچنین قادر است چند عنصر موجود در کتابخانه کاربر را با یکدیگر ترکیب کند. در نتیجه، بخش‌هایی از خروجی‌های قبلی می‌توانند به مواد اولیه یک قطعه تازه تبدیل شوند.

تصویر و ویدئو هم می‌توانند به پرامپت موسیقی تبدیل شوند

ورودی مدل نیز دیگر به توضیحات متنی محدود نیست. سونو v۶ می‌تواند با دریافت تصویر، ویدئو یا فایل صوتی موسیقی ایجاد کند. برای نمونه، کاربر می‌تواند یک تصویر را به مدل بدهد و از آن بخواهد آهنگی متناسب با فضای بصری آن بسازد یا یک ویدئو را برای تولید موسیقی متن استفاده کند. این قابلیت سونو را به ابزاری کاربردی‌تر برای سازندگان ویدئو، بازی و محتوای شبکه‌های اجتماعی تبدیل می‌کند، زیرا کاربر برای توضیح کامل حال‌وهوای یک صحنه مجبور نیست همه جزئیات را به متن تبدیل کند.

مدل‌های قدیمی به‌تدریج کنار گذاشته می‌شوند

سونو عرضه v۶ را آغاز کرده و قصد دارد مدل‌های قبلی خود را در آینده بازنشسته کند. شرکت هنوز زمان مشخصی برای کنار گذاشتن کامل نسل‌های قدیمی اعلام نکرده است.

اهمیت v۶ فقط به بهبود کیفیت تولید موسیقی محدود نمی‌شود. استفاده از داده‌های دارای مجوز نشان می‌دهد سونو در حال تغییر رابطه خود با صنعت موسیقی است و می‌خواهد شرکت‌هایی را که زمانی در برابر مدل‌های مولد قرار داشتند، به بخشی از زنجیره توسعه آن‌ها تبدیل کند. با این حال، پرسش درباره منشأ کامل داده‌های آموزشی همچنان باقی است و کیفیت فنی مدل نیز هنوز نتوانسته یکی از دشوارترین ویژگی‌های موسیقی انسانی، یعنی همان نقص‌ها و بی‌نظمی‌های طبیعی، را به‌طور قانع‌کننده بازسازی کند.

انتهای پیام/

ارسال نظر