گوگل در ژانویهٔ ۲۰۲۳ مقالهٔ پژوهشی MusicLM را منتشر کرد؛ مدلی که توضیح متنی را به موسیقی ۲۴ کیلوهرتزی تبدیل میکرد و میتوانست برای چند دقیقه انسجام نسبی خود را حفظ کند. آن زمان MusicLM محصول عمومی نبود و نگرانی دربارهٔ حق نشر و شباهت خروجی به دادههای آموزش، عرضهٔ مستقیم آن را محدود کرده بود.
امروز وضعیت تغییر کرده است. فناوری MusicLM از محیط آزمایشگاهی به تجربهٔ عمومی MusicFX در labs.google/fx رسیده و کاربران کشورهای پشتیبانیشده میتوانند با متن، ایدهٔ موسیقایی بسازند، Loop تولید کنند و خروجی را دانلود یا به اشتراک بگذارند. این مقاله مسیر MusicLM تا MusicFX، قابلیتهای فعلی، دسترسی، نحوهٔ نوشتن پرامپت و محدودیتهای حقوقی را بهروز میکند.
MusicLM چه بود؟
MusicLM یک مدل پژوهشی Text-to-Music از Google Research بود. ورودی آن توضیحی مانند «ملودی آرام ویولن همراه با ریف گیتار دیستورشن» و خروجی آن فایل موسیقی مرتبط با متن بود. معماری مدل، تولید موسیقی را به مسئلهٔ سلسلهمراتبی Sequence-to-Sequence تبدیل میکرد و تلاش داشت هم کیفیت صوتی و هم ارتباط با توضیح را حفظ کند.
عنوان قدیمی «ChatGPT برای موسیقی» تشبیه رسانهای قابلفهمی بود، اما از نظر فنی دقیق نیست. ChatGPT مدل زبانی مکالمهای است؛ MusicLM برای تولید Audio از شرط متنی آموزش دیده بود. رابط هر دو میتواند متن باشد، ولی نوع داده، هدف آموزش و خروجی متفاوت است.
گوگل در انتشار اولیه، مدل را مستقیماً برای استفادهٔ عمومی عرضه نکرد. صفحهٔ پژوهش، نمونههای صوتی و اطلاعات دیتاست را ارائه میکرد تا قابلیت و محدودیتها قابلبررسی باشند. بعدتر تجربههای عملی در AI Test Kitchen و سپس MusicFX عرضه شدند.
قابلیتهای پژوهشی MusicLM
MusicLM میتوانست موسیقی ۲۴ کیلوهرتزی تولید کند و طبق مقالهٔ رسمی، در بازهٔ چنددقیقهای انسجام نسبی داشته باشد. مدل هم با توضیح مفصل و هم عبارت کوتاه مانند «جز آرامشبخش» کار میکرد، اما پرامپت دقیقتر کنترل بیشتری بر سازبندی، فضا، تمپو و انرژی میداد.
یکی از آزمایشهای مهم، شرطگذاری با ملودی بود. کاربر میتوانست یک ملودی را زمزمه یا سوت بزند و همراه آن سبک موردنظر را توصیف کند؛ مدل تلاش میکرد شکل ملودی را با رنگ و تنظیم جدید بازسازی کند. این قابلیت نشان میداد Text-to-Music میتواند فقط مولد تصادفی نباشد و از ایدهٔ موسیقایی انسان پیروی کند.
پژوهش همچنین تولید موسیقی برای توضیح نقاشی، روایت یا فضای بصری را نمایش میداد. این مثالها بیشتر برای سنجش ارتباط معنایی بودند، نه تضمین اینکه مدل بتواند موسیقی متن کامل فیلم را با ساختار دقیق بسازد.
دیتاست MusicCaps
گوگل همراه پژوهش، MusicCaps را منتشر کرد؛ دیتاستی شامل حدود ۵۵۰۰ جفت موسیقی و توضیح متنی که توضیحات آن توسط متخصصان انسانی نوشته شده بود. هدف این مجموعه، ارزیابی و پژوهش دربارهٔ ارتباط متن و موسیقی بود.
MusicCaps خود مدل MusicLM نیست و داشتن دیتاست به معنی دسترسی به وزنهای مدل نیست. این مجموعه برای مطالعهٔ Captioning، Retrieval و ارزیابی Text-to-Music کاربرد دارد. پژوهشگر باید شرایط مجوز، منبع فایلها و محدودیت استفاده را جداگانه بررسی کند.
MusicFX؛ نسخهٔ عمومی ایده
گوگل در تجربهٔ MusicFX امکان ساخت موسیقی با پرامپت متنی را عمومیتر کرد. MusicFX بخشی از labs.google/fx است و با حساب گوگل اجرا میشود. کاربر ایده را توضیح میدهد و سامانه چند گزینه تولید میکند. ابزارهای رابط مانند Expressive Chips پیشنهادهایی برای تغییر سبک، ساز، فضا یا ویژگیهای پرامپت ارائه میدهند.
در بهروزرسانی رسمی سال ۲۰۲۴، گوگل اعلام کرد MusicFX میتواند قطعههایی تا حدود ۷۰ ثانیه و Loop تولید کند، خروجی را دانلود یا Share کند و نسبت به نسخههای اولیه کیفیت بالاتر و تولید سریعتری داشته باشد. محصول فعلی همچنان یک آزمایش Generative AI است و رابط یا سهمیهٔ آن میتواند تغییر کند.
MusicFX DJ نیز رویکردی تعاملیتر دارد و کاربر میتواند عناصر، ژانرها و بافتها را ترکیب و در جریان پخش تغییر دهد. این حالت برای ایدهپردازی و اجرای آزمایشی مفید است، اما جای DAW با Timeline، Automation و میکس چندترکه را نمیگیرد.
دسترسی، زبان و محدودیتها
طبق FAQ رسمی، استفاده از labs.google/fx برای افراد ۱۸ سال به بالا و در کشورهای فهرستشده ممکن است. فهرست دسترسی جغرافیایی تغییرپذیر است و در زمان نگارش، ایران در میان کشورهای اعلامشده دیده نمیشود. بنابراین نمایش زبان فارسی در فهرست زبانهای رابط، لزوماً به معنی فعال بودن سرویس برای همهٔ کاربران داخل ایران نیست.
گوگل فارسی را در میان زبانهای پشتیبانیشدهٔ سایت ذکر میکند، اما برای بهترین نتیجه استفاده از پرامپت انگلیسی را پیشنهاد میدهد. کیفیت خروجی بسته به زبان و پیچیدگی متن متفاوت است. سهمیهٔ روزانه نیز وجود دارد و پس از پایان سهمیه باید تا زمان بعدی صبر کرد.
تعاملها، خروجیها، اطلاعات استفاده و بازخورد ممکن است برای بهبود محصولات بررسی شوند. طبق توضیح گوگل، بازبینی انسانی با اقداماتی برای جدا کردن داده از حساب انجام میشود. بااینحال نباید اطلاعات محرمانه، فایل متعلق به مشتری یا جزئیات پروژهٔ منتشرنشده را بدون بررسی سیاست حریم خصوصی وارد کرد.
نوشتن پرامپت مؤثر برای موسیقی
پرامپت خوب مجموعهای از ویژگیهای شنیداری است، نه فقط نام یک ژانر. مدل باید بداند چه سازهایی، چه سرعتی، چه انرژی، چه بافتی و چه ساختاری موردنظر است. بهتر است عناصر را از کلی به جزئی بنویسید.
| مولفه | نمونه |
|---|---|
| سبک و نقش | موسیقی پسزمینهٔ الکترونیک سینمایی |
| تمپو | حدود ۱۱۰ BPM، ریتم ثابت |
| سازبندی | پد آنالوگ گرم، بیس نرم، پرکاشن فلزی |
| حس | مرموز اما امیدوارکننده |
| فضا و میکس | استریوی عریض، ریورب متوسط، بدون وکال |
| ساختار | شروع خلوت، افزایش تدریجی انرژی، پایان Loop-friendly |
نمونهٔ پرامپت: «Instrumental cinematic electronica at 110 BPM, warm analog pads, soft sub bass, sparse metallic percussion, mysterious but hopeful mood, wide stereo image, medium reverb, no vocals, seamless loop ending.»
بهجای درخواست «موسیقی دقیقاً شبیه هنرمند X»، خصوصیات موسیقایی را توضیح دهید. این روش هم نتیجهٔ قابلکنترلتری میدهد و هم با محافظتهای MusicFX برای سبک و صدای هنرمندان تضاد کمتری دارد.
کاربرد MusicFX در تولید موسیقی
MusicFX را بهتر است ابزار Sketch و تولید مادهٔ خام در نظر گرفت. میتوانید برای ویدیو چند Mood آزمایشی بسازید، بافت و Ambience تولید کنید، ریتم یا سازبندی را بشنوید و از نتیجه برای نوشتن قطعهٔ اصلی الهام بگیرید.
- نیاز پروژه را به یک جملهٔ روشن تبدیل کنید.
- سه تا پنج خروجی با تغییر محدود پرامپت بسازید.
- بخشهای مفید را انتخاب و دانلود کنید.
- در DAW، BPM و Key را تحلیل کنید.
- فایل را Cut، Warp، EQ و Level Match کنید.
- سازها و اجرای شخصی را اضافه کنید تا هویت پروژه شکل بگیرد.
- پرامپت، تاریخ تولید و شرایط استفاده را کنار پروژه ثبت کنید.
خروجی ممکن است Structure یا Transient مناسبی برای میکس نداشته باشد. Stemهای مستقل نیز همیشه در دسترس نیستند. برای کنترل بیشتر میتوان بخش کوتاهی را بهعنوان Reference، Texture یا Sample استفاده کرد و Arrangement اصلی را در DAW ساخت.
حق نشر، SynthID و سبک هنرمندان
گوگل روی خروجیهای MusicFX نشان نامحسوس SynthID قرار میدهد تا محتوای تولیدشده با AI قابلشناسایی باشد. این Watermark برای گوش انسان قابلشنیدن نیست اما سامانهٔ تشخیص میتواند آن را شناسایی کند.
MusicFX برای درخواستهایی که نام هنرمند مشخص یا وکال تقلیدی دارند محدودیتهایی اعمال میکند. این محافظت احتمال سوءاستفاده را کم میکند، اما مسئولیت کاربر را حذف نمیکند. قبل از انتشار تجاری، Terms of Service را بخوانید. گوگل میگوید روی محتوای اصلی تولیدشده ادعای مالکیت نمیکند، ولی استفاده همچنان تابع شرایط سرویس و قوانین کشور است.
اگر خروجی شباهت واضحی به قطعهٔ موجود دارد، آن را منتشر نکنید یا به شکل اساسی بازطراحی کنید. استفاده از نام، صدای خواننده یا هویت هنرمند بدون رضایت میتواند علاوه بر حق نشر، حقوق شخصیت و تبلیغات را نیز درگیر کند.
آیا MusicLM همان ChatGPT موسیقی بود؟
نه. شباهت اصلی، دریافت دستور متنی و تولید خروجی است. ChatGPT متن و مکالمه تولید میکند؛ MusicLM و MusicFX سیگنال صوتی میسازند. مدل موسیقی باید روابط زمانی، ریتم، هارمونی، Timbre و کیفیت Waveform را همزمان مدیریت کند.
همچنین MusicFX چتبات کامل برای مدیریت پروژه نیست. نمیتواند جای آهنگساز، نوازنده، تنظیمکننده و مهندس میکس را در تمام مراحل بگیرد. توان اصلی آن تبدیل سریع توصیف به چند ایدهٔ شنیداری است.
جمعبندی
MusicLM در سال ۲۰۲۳ یک دستاورد پژوهشی مهم بود: موسیقی ۲۴ کیلوهرتزی و چنددقیقهای از متن، شرطگذاری با ملودی و انتشار دیتاست MusicCaps. نسخهٔ عمومی مستقیم آن زمان عرضه نشد، اما فناوری و بازخوردها مسیر را برای MusicFX باز کردند.
امروز MusicFX در کشورهای پشتیبانیشده برای کاربران ۱۸ سال به بالا در دسترس است و میتواند با متن موسیقی و Loop بسازد. کیفیت بهتر و رابط سادهتر شده، اما محدودیت سهمیه، دسترسی جغرافیایی، کنترل ساختار و مسائل حقوقی باقیاند. این ابزار برای ایدهپردازی قدرتمند است؛ نتیجهٔ نهایی همچنان به انتخاب، تنظیم، اجرا و هویت موسیقایی انسان نیاز دارد.
منابع رسمی: پژوهش MusicLM، MusicFX، FAQ رسمی labs.google/fx و معرفی قابلیتهای MusicFX.