سونو نخستین مدل هوش مصنوعی موسیقی خود را با همکاری شرکتهای ضبط منتشر کرد
به گزارش خبرگزاری آنا؛ مدل v۶ نقطه عطف مهمی برای سونو محسوب میشود، زیرا نسلهای قبلی این سرویس با انتقادها و اختلافهای حقوقی درباره منابع داده آموزشی روبهرو بودند. جک برودی از سونو گفته است مدل جدید از ابتدا و با مجموعه داده تازهای آموزش داده شده و دادههای آموزشی نسلهای پیشین در آن مورد استفاده قرار نگرفتهاند. بخشی از این مجموعه شامل محتوای دارای مجوز شرکای صنعت موسیقی و بخشی دیگر شامل دادههای کاربران است، اما هنوز مشخص نیست تمام دادههای مورد استفاده در آموزش مدل از منابعی تهیه شدهاند که وضعیت حقوقی آنها کاملاً روشن است.
صنعت موسیقی برای نخستین بار در آموزش مدل نقش داشته است
سونو طی ماههای گذشته با چند شرکت بزرگ و مستقل صنعت موسیقی به توافق رسیده است. وارنر موزیک گروپ، BMG و Believe از جمله مجموعههایی هستند که محتوای دارای مجوز آنها در دادههای آموزشی v۶ قرار گرفته است. این تغییر در شرایطی اتفاق افتاده که یکی از مهمترین مناقشات پیرامون مولدهای موسیقی هوش مصنوعی، استفاده از آثار دارای حق نشر برای آموزش مدلها بدون کسب اجازه بوده است.
سونو تأکید دارد v۶ با دادههایی متفاوت از نسلهای قبلی ساخته شده است. این موضوع میتواند تلاشی برای ایجاد مدل تجاری پایدارتر و کاهش تنش با ناشران و صاحبان آثار باشد، هرچند شرکت جزئیات دقیقی درباره سهم هر منبع در مجموعه داده آموزشی یا فهرست کامل آثار استفادهشده منتشر نکرده است.
v۶ در سه نسخه عرضه میشود
نسل تازه سونو برخلاف گذشته تنها یک مدل نیست و در سه نسخه v۶-wild ،v۶ و v۶-mini ارائه میشود. نسخه مینی برای همه کاربران بهصورت رایگان در دسترس خواهد بود و با هدف تولید سریعتر و مصرف منابع پردازشی کمتر توسعه یافته است. در مقابل، خروجیهای آن سادهتر هستند و ممکن است نشانههای مصنوعی بودن موسیقی در آنها بیشتر دیده شود.
نسخه v۶ مدل اصلی این خانواده محسوب میشود و بالاترین تعادل میان کیفیت و کنترل را هدف گرفته است. نسخه v۶-wild نیز قرار است خروجیهای غیرقابلپیشبینیتر تولید کند و به گفته سونو، برای ایجاد اتفاقهای خوشایند و نقصهای طبیعی طراحی شده است؛ یعنی همان اشتباهها و تفاوتهای ظریفی که میتوانند اجرای موسیقی انسانی را از یک اجرای بیش از حد دقیق متمایز کنند. با این حال آزمایش اولیه د ورج نشان داده تفاوت میان نسخه wild و v۶ استاندارد همیشه بهسادگی قابل تشخیص نیست. مدل حتی با دستورهای مستقیم برای اجرای خارج از کوک یا بینظم، تمایل دارد موسیقی هماهنگ و از نظر ریتم دقیق تولید کند.
شناخت سبکهای موسیقی بسیار بهتر شده است
یکی از پیشرفتهای محسوس نسل جدید، درک بهتر ژانرهای موسیقی است. مدلهای قدیمی سونو گاهی حتی با دریافت نام مشخص یک سبک، تنها خروجیای تقریباً مشابه آن ایجاد میکردند و ویژگیهای اصلی ژانر را از دست میدادند.
v۶ در آزمایشهای اولیه توانسته نشانههای مشخص سبکهایی مانند هایپرپاپ یا کراوتراک را بهتر بازسازی کند. مدل در سازبندی، ساختار قطعه، نوع ریتم و جنس صدا بهتر تشخیص میدهد کاربر هنگام اشاره به یک ژانر مشخص چه ویژگیهایی را انتظار دارد. این پیشرفت میتواند برای کاربرانی اهمیت داشته باشد که به جای تولید یک قطعه عمومی، موسیقی با هویت سبکی مشخص میخواهند. با این حال، شناخت بهتر ویژگیهای ظاهری یک ژانر الزاماً به معنای توانایی مدل در بازسازی تمام ظرافتهای هنری یا اجرایی آن نیست.
هوش مصنوعی هنوز نمیتواند عمداً «بد» بنوازد
یکی از تناقضهای جالب v۶ این است که با وجود پیشرفت فنی، همچنان برای بازسازی نقصهای طبیعی اجرای انسان مشکل دارد. درخواستهایی مانند نواختن پیانویی خارج از کوک، اجرای بیقاعده بدون توجه به ضرب یا آواز یکنواخت در آزمایشها اغلب نادیده گرفته شدهاند و مدل دوباره به سمت خروجی منظم و هماهنگ برگشته است.
اجرای انسانی الزاماً از نظر زمانبندی، کوک و شدت صدا بینقص نیست و همین تفاوتهای کوچک گاهی بخش مهمی از شخصیت یک قطعه را شکل میدهند. مدلهای مولد معمولاً از الگوهای موجود یاد میگیرند که چگونه یک موسیقی «درست» به نظر برسد و در نتیجه تولید اشتباه کنترلشده میتواند برای آنها دشوارتر از ایجاد یک اجرای تمیز باشد. نسخه wild قرار است بخشی از این مشکل را برطرف کند، اما ارزیابی اولیه نشان میدهد سونو هنوز به هدف خود در ایجاد نقصهای طبیعی نرسیده است. برخی آثار مصنوعی در صدای خواننده نیز باقی ماندهاند و در مواردی حتی برجستهتر از نسل پنجم شنیده میشوند.
دیگر برای اصلاح یک بخش نیازی به ساخت دوباره کل آهنگ نیست
تغییر مهمتر v۶ ممکن است نه در کیفیت صدا، بلکه در نحوه تعامل با مدل باشد. کاربران اکنون میتوانند داخل یک محیط گفتوگومحور درباره قسمت مشخصی از آهنگ دستور بدهند و همان بخش را تغییر دهند. برای مثال، اگر کاربر تنها از خط گیتار یک قسمت راضی نباشد یا بخواهد یک مصرع را عوض کند، دیگر لازم نیست کل قطعه از ابتدا تولید شود. مدل میتواند عنصر موردنظر را تغییر دهد و بخشهای دیگر آهنگ را تا حد امکان حفظ کند. این رویکرد، تولید موسیقی با سونو را از یک فرایند مبتنی بر «ساخت دوباره و انتخاب بهترین نتیجه» به ویرایش مرحلهبهمرحله نزدیکتر میکند.
v۶ همچنین قادر است چند عنصر موجود در کتابخانه کاربر را با یکدیگر ترکیب کند. در نتیجه، بخشهایی از خروجیهای قبلی میتوانند به مواد اولیه یک قطعه تازه تبدیل شوند.
تصویر و ویدئو هم میتوانند به پرامپت موسیقی تبدیل شوند
ورودی مدل نیز دیگر به توضیحات متنی محدود نیست. سونو v۶ میتواند با دریافت تصویر، ویدئو یا فایل صوتی موسیقی ایجاد کند. برای نمونه، کاربر میتواند یک تصویر را به مدل بدهد و از آن بخواهد آهنگی متناسب با فضای بصری آن بسازد یا یک ویدئو را برای تولید موسیقی متن استفاده کند. این قابلیت سونو را به ابزاری کاربردیتر برای سازندگان ویدئو، بازی و محتوای شبکههای اجتماعی تبدیل میکند، زیرا کاربر برای توضیح کامل حالوهوای یک صحنه مجبور نیست همه جزئیات را به متن تبدیل کند.
مدلهای قدیمی بهتدریج کنار گذاشته میشوند
سونو عرضه v۶ را آغاز کرده و قصد دارد مدلهای قبلی خود را در آینده بازنشسته کند. شرکت هنوز زمان مشخصی برای کنار گذاشتن کامل نسلهای قدیمی اعلام نکرده است.
اهمیت v۶ فقط به بهبود کیفیت تولید موسیقی محدود نمیشود. استفاده از دادههای دارای مجوز نشان میدهد سونو در حال تغییر رابطه خود با صنعت موسیقی است و میخواهد شرکتهایی را که زمانی در برابر مدلهای مولد قرار داشتند، به بخشی از زنجیره توسعه آنها تبدیل کند. با این حال، پرسش درباره منشأ کامل دادههای آموزشی همچنان باقی است و کیفیت فنی مدل نیز هنوز نتوانسته یکی از دشوارترین ویژگیهای موسیقی انسانی، یعنی همان نقصها و بینظمیهای طبیعی، را بهطور قانعکننده بازسازی کند.
انتهای پیام/