تولید تصویر با هوش مصنوعی؛ از متن تا تصویر | قسمت ۱۵
تولید تصویر با هوش مصنوعی
قسمت پانزدهم: تولید تصویر با هوش مصنوعی؛ وقتی متن به تصویر تبدیل میشود
تولید تصویر با هوش مصنوعی چگونه انجام میشود؟ با هوش مصنوعی مولد، مدلهای انتشار، Prompt، DALL·E و مسیر تبدیل متن به تصویر آشنا شوید.
تحقیق و تدوین مهدی گمرکی
در قسمت چهاردهم، به یکی از مهمترین نقاط تحول هوش مصنوعی رسیدیم؛ جایی که درباره Transformer، مفهوم Attention و مدلهای زبانی بزرگ یا LLM صحبت کردیم.
دیدیم که چگونه معماری Transformer به مدلهای زبانی کمک کرد ارتباط میان بخشهای مختلف متن را بهتر یاد بگیرند و در نهایت، فناوریهایی مانند GPT و ChatGPT به وجود آمدند.
اما یک سؤال جذاب باقی میماند:
اگر هوش مصنوعی میتواند از روی متن، متن جدید تولید کند، آیا میتواند از روی متن، تصویر هم بسازد؟
مثلاً اگر به یک هوش مصنوعی بگوییم:
«یک شهر آیندهنگر در شب، با ساختمانهای شیشهای، خودروهای پرنده و نورهای نئونی ایجاد کن.»
آیا واقعاً میتواند چنین تصویری بسازد؟
اینجاست که وارد دنیای تولید تصویر با هوش مصنوعی میشویم.
هوش مصنوعی مولد چیست؟
قبل از اینکه سراغ تولید تصویر برویم، باید با یک مفهوم مهم آشنا شویم:
هوش مصنوعی مولد یا Generative AI
مدلهای سنتی هوش مصنوعی معمولاً برای کارهایی مانند تشخیص، دستهبندی یا پیشبینی استفاده میشدند.
مثلاً یک مدل میتوانست به یک تصویر نگاه کند و بگوید:
«این تصویر یک گربه است.»
اما مدل مولد میتواند یک قدم فراتر برود.
به جای اینکه فقط تصویر را تشخیص دهد، میتواند:
«یک تصویر جدید از یک گربه ایجاد کند.»
همین تفاوت، دنیای جدیدی را به وجود آورد.
در هوش مصنوعی مولد، هدف فقط پیدا کردن پاسخ در دادههای قبلی نیست؛ بلکه مدل تلاش میکند بر اساس الگوهایی که در فرایند آموزش یاد گرفته، محتوای جدید تولید کند.
این محتوا میتواند متن، تصویر، صدا، ویدئو یا حتی کد باشد.
تولید تصویر با هوش مصنوعی چگونه کار میکند؟
تولید تصویر با هوش مصنوعی چگونه کار میکند؟
حالا سؤال اصلی:
یک ماشین چگونه از چند کلمه، یک تصویر تولید میکند؟
برای درک ساده موضوع، فرض کنید شما به یک مدل میگویید:
«یک ربات در حال قدم زدن در تهران آیندهنگر.»
مدل باید چند مفهوم را از این جمله استخراج کند:
🤖 ربات
🚶 در حال قدم زدن
🏙️ شهر
🇮🇷 تهران
🔮 فضای آیندهنگر
اما کار همینجا تمام نمیشود.
مدل باید یاد بگیرد این مفاهیم چگونه باید در یک تصویر با یکدیگر ارتباط داشته باشند.
ربات کجا قرار بگیرد؟
ساختمانها چه شکلی باشند؟
نورپردازی چگونه باشد؟
زاویه دوربین چطور انتخاب شود؟
و مهمتر از همه:
چگونه تمام این مفاهیم در یک تصویر واحد کنار هم قرار بگیرند؟
مدل تصویر را مثل یک نقاش انسان نمیکشد
یک تصور اشتباه این است که مدل هوش مصنوعی مانند یک نقاش دیجیتال، ابتدا سر ربات را میکشد، سپس بدن آن را اضافه میکند و در پایان پسزمینه را میسازد.
در بسیاری از مدلهای مدرن تولید تصویر، فرایند به این شکل ساده نیست.
یکی از رویکردهای بسیار مهم در این حوزه، مدلهای انتشار یا Diffusion Models هستند.
برای درک ایده آنها، یک آزمایش ذهنی انجام دهیم.
فرض کنید تصویر یک گربه را داریم و کمکم روی آن نویز اضافه میکنیم.
در ابتدا:
🐱 تصویر کاملاً واضح است.
بعد:
🐱 → 🌫️
تصویر کمی خراب میشود.
دوباره نویز اضافه میکنیم:
🌫️ → 🌫️
تا جایی که در نهایت، تصویر تقریباً به یک توده نویز تبدیل میشود.
حالا مدل یاد میگیرد این فرایند را برعکس انجام دهد.
یعنی از نویز شروع کند و مرحلهبهمرحله تصویری معنادار ایجاد کند.
از نویز تا تصویر
اینجا یکی از جذابترین ایدههای تولید تصویر با هوش مصنوعی شکل میگیرد.
مدل میتواند از یک وضعیت شبیه نویز شروع کند و طی چند مرحله، آن را به تصویری تبدیل کند که با درخواست کاربر هماهنگ باشد.
به شکل ساده:
نویز >>> شکلهای اولیه >>> جزئیات >>> تصویر نهایی
البته در مدلهای واقعی، این فرایند بسیار پیچیدهتر است و از شبکههای عصبی، نمایشهای فشرده تصویر و سازوکارهای مختلف برای هدایت تولید استفاده میشود.
اما برای یادگیری مفهومی، همین تصویر ذهنی کافی است:
هوش مصنوعی از آشفتگی شروع میکند و به سمت ساختاری معنادار حرکت میکند.
متن چگونه به تصویر دستور میدهد؟
حالا بخش جالب ماجرا:
مدل از کجا میفهمد شما نوشتهاید:
«یک گربه سفید روی ماه، در سبک سینمایی»؟
اینجا دوباره به دنیای زبان و ارتباط میان متن و تصویر برمیگردیم.
سیستم باید متن شما را به شکلی تبدیل کند که مدل بتواند ارتباط آن را با ویژگیهای تصویری درک کند.
در بسیاری از سامانههای مدرن، یک بخش متن را به نمایش عددی یا Embedding تبدیل میکند.
در طرف دیگر، تصویر نیز میتواند در یک فضای عددی نمایش داده شود.
مدل تلاش میکند ارتباط میان این دو فضا را یاد بگیرد:
متن ↔ مفهوم ↔ ویژگیهای تصویری
به همین دلیل است که مدل میتواند بفهمد «گربه سفید» با «گربه سیاه» تفاوت دارد یا «شب» با «روز» یک مفهوم نیست.
DALL·E چه نقشی در این داستان دارد؟
در مسیر پیشرفت مدلهای تولید تصویر، نام DALL·E بسیار مشهور شد.
DALL·E نمونهای از سیستمهایی است که نشان دادند میتوان از توضیحات متنی برای تولید تصاویر استفاده کرد.
یعنی به جای اینکه کاربر با نرمافزارهای پیچیده طراحی کار کند، میتواند ایده خود را با زبان طبیعی توضیح دهد.
مثلاً:
«یک خانه کوچک چوبی در میان جنگل، در یک صبح مهآلود پاییزی.»
و مدل تلاش میکند تصویری متناسب با این توصیف ایجاد کند.
این اتفاق یک تغییر مهم در رابطه انسان و کامپیوتر بود.
تا قبل از آن، برای ایجاد یک تصویر باید ابزارهای طراحی، مهارتهای گرافیکی و زمان زیادی در اختیار داشتیم.
اما هوش مصنوعی مولد یک رابط جدید معرفی کرد:
زبان انسان → محتوا
Prompt چیست؟
وقتی با ابزارهای تولید تصویر کار میکنیم، احتمالاً با واژهای به نام Prompt یا پرامپت مواجه میشویم.
پرامپت همان دستوری است که به مدل میدهیم.
مثلاً:
پرامپت ساده:
«یک ربات در شهر.»
اما میتوانیم آن را دقیقتر کنیم:
«یک ربات انساننما در خیابانهای یک شهر آیندهنگر، شب، نورهای نئونی، باران، نمای سینمایی، جزئیات بسیار زیاد.»
هرچه توصیف دقیقتر باشد، اطلاعات بیشتری درباره نتیجه مورد انتظار در اختیار مدل قرار میگیرد.
البته یک پرامپت طولانی لزوماً همیشه بهتر نیست؛ مهمتر از طول پرامپت، شفافیت و ساختار آن است.
آیا هوش مصنوعی واقعاً تصویر را میفهمد؟
اینجا باید یک نکته مهم را به خاطر بسپاریم.
وقتی میگوییم مدل «میفهمد» که یک گربه چیست، نباید این عبارت را دقیقاً مانند فهم انسان تفسیر کنیم.
مدل بر اساس دادههای آموزشی، الگوها و روابط آماری بسیار پیچیدهای را یاد گرفته است.
اگر میلیونها نمونه تصویر و توضیح متنی مرتبط با گربهها در دادههای آموزشی وجود داشته باشد، مدل میتواند الگوهایی مربوط به شکل بدن، گوشها، چشمها، موها و سایر ویژگیها را یاد بگیرد.
بنابراین وقتی شما میگویید:
«یک گربه سفید»
مدل بر اساس روابط آموختهشده تلاش میکند تصویری تولید کند که با این مفهوم سازگار باشد.
چرا گاهی دستهای عجیب میبینیم؟
احتمالاً تصاویر تولیدشده توسط هوش مصنوعی را دیدهاید که در آنها:
✋ تعداد انگشتها اشتباه است.
👁️ چشمها نامتقارناند.
📝 نوشتههای روی تصویر ناخوانا هستند.
🚗 جزئیات اشیا عجیب به نظر میرسند.
دلیل این اتفاق آن است که تولید تصویر، یک فرایند ساده کپیکردن از نمونههای آموزشی نیست.
مدل باید ساختارهای پیچیدهای را ایجاد کند و گاهی در بازسازی جزئیات دقیق دچار خطا میشود.
البته کیفیت مدلهای تولید تصویر در سالهای اخیر به شکل چشمگیری افزایش یافته و بسیاری از این مشکلات در مدلهای جدید کمتر شدهاند؛ اما همچنان نمیتوان گفت تولید تصویر همیشه بدون خطا است.
Transformer و مدلهای تصویری چه ارتباطی دارند؟
حالا سؤال مهمی که از قسمت قبل باقی مانده بود:
اگر Transformer برای زبان مهم است، آیا فقط در زبان کاربرد دارد؟
خیر.
ایدههای Transformer به حوزههای دیگری نیز راه پیدا کردهاند.
امروزه معماریها و روشهای مبتنی بر Transformer در حوزههایی مانند:
- متن
- تصویر
- صدا
- ویدئو
- مدلهای چندوجهی
به کار گرفته میشوند.
از طرف دیگر، مدلهای انتشار نیز نقش بسیار مهمی در پیشرفت تولید تصویر داشتهاند.
بنابراین دنیای هوش مصنوعی مدرن فقط یک معماری یا یک الگوریتم واحد نیست؛ بلکه مجموعهای از ایدهها و معماریهاست که در کنار یکدیگر تکامل پیدا کردهاند.
از متن و تصویر تا هوش مصنوعی چندوجهی
حالا تصور کنید مدلی داشته باشیم که فقط متن را پردازش نکند.
بلکه بتواند:
📖 متن را بخواند
🖼️ تصویر را ببیند
🎙️ صدا را بشنود
🎥 ویدئو را تحلیل کند
💬 پاسخ تولید کند
اینجاست که به مفهوم هوش مصنوعی چندوجهی یا Multimodal AI میرسیم.
برای مثال، شما تصویری از یک موتور خودرو را به یک مدل میدهید و از آن میخواهید:
«این تصویر را بررسی کن و توضیح بده کدام بخشها را میبینی.»
مدل باید بتواند اطلاعات تصویری و زبانی را در یک فرایند مشترک پردازش کند.
این دقیقاً همان مسیری است که هوش مصنوعی در حال حرکت به سمت آن است.
یک انقلاب جدید در راه است
اگر تا چند سال پیش برای ساخت یک تصویر باید ساعتها با نرمافزارهای گرافیکی کار میکردیم، امروز میتوانیم ایده خود را با چند جمله توصیف کنیم.
اما این تنها یک تغییر در طراحی نیست.
رابط انسان و ماشین در حال تغییر است.
در گذشته:
انسان → ابزار → دستورهای پیچیده → نتیجه
اما در بسیاری از ابزارهای هوش مصنوعی مولد:
انسان → زبان طبیعی → هوش مصنوعی → نتیجه
ما کمکم در حال حرکت از «کار کردن با نرمافزار» به سمت «گفتگو با نرمافزار» هستیم.
و این تغییر، یکی از مهمترین اتفاقات عصر هوش مصنوعی است.
قسمت بعد چه میشود؟
تا اینجا سه دنیای مهم را دیدیم:
🧠 یادگیری ماشین
⬇️
🤖 یادگیری عمیق
⬇️
✨ هوش مصنوعی مولد
اما هنوز یک سؤال بزرگ باقی مانده است:
اگر هوش مصنوعی بتواند متن و تصویر تولید کند، آیا میتواند صدا و ویدئو هم بسازد؟
آیا میتوان به یک مدل گفت:
«یک شخصیت را در حال صحبت کردن نشان بده»
و چند لحظه بعد، یک ویدئوی واقعی دریافت کرد؟
در قسمت شانزدهم، وارد دنیای تولید صدا و ویدئو با هوش مصنوعی میشویم؛ جایی که مرز میان واقعیت و محتوای تولیدشده توسط ماشین روزبهروز باریکتر میشود.
جمعبندی قسمت پانزدهم
در این قسمت یاد گرفتیم که:
- 🔹 هوش مصنوعی مولد میتواند محتوای جدید تولید کند.
- 🔹 مدلهای تولید تصویر میتوانند از توضیحات متنی برای ساخت تصویر استفاده کنند.
- 🔹 Diffusion Models یکی از رویکردهای مهم در تولید تصویر هستند.
- 🔹 مدل میتواند فرایند تولید را از نویز به سمت یک تصویر معنادار هدایت کند.
- 🔹 Prompt دستور یا توضیحی است که برای هدایت مدل استفاده میکنیم.
- 🔹 DALL·E یکی از نمونههای شناختهشده در مسیر توسعه تولید تصویر از متن است.
- 🔹 آینده هوش مصنوعی به سمت مدلهای چندوجهی حرکت میکند؛ مدلهایی که میتوانند انواع مختلف داده مانند متن، تصویر، صدا و ویدئو را پردازش کنند.
و شاید مهمترین نکته این باشد:
ما دیگر فقط از هوش مصنوعی برای شناخت جهان استفاده نمیکنیم؛ حالا میتوانیم از آن بخواهیم جهانهای جدیدی بسازد.
پرسشهای متداول
تولید تصویر با هوش مصنوعی چیست؟
تولید تصویر با هوش مصنوعی به فرایندی گفته میشود که در آن یک مدل یادگیری ماشین میتواند بر اساس دستور یا شرایط مشخص، تصویر جدید تولید کند.
Diffusion Model چیست؟
مدل انتشار یا Diffusion Model یکی از رویکردهای مهم برای تولید محتواست که در بسیاری از مدلهای تولید تصویر استفاده شده و ایده اصلی آن، یادگیری فرایند تبدیل نویز به داده معنادار است.
Prompt در تولید تصویر چیست؟
Prompt متنی است که کاربر برای توضیح تصویر موردنظر خود به مدل میدهد و مدل از آن برای هدایت فرایند تولید استفاده میکند.
آیا DALL·E یک مدل تولید تصویر است؟
DALL·E نام خانوادهای از مدلهای تولید تصویر از متن است که برای ایجاد تصاویر بر اساس توضیحات متنی توسعه یافتهاند.
آیا هوش مصنوعی واقعاً تصویر را میفهمد؟
مدلهای هوش مصنوعی الگوها و روابط پیچیده موجود در دادههای آموزشی را یاد میگیرند. استفاده از واژه «فهمیدن» برای آنها یک سادهسازی آموزشی است و نباید دقیقاً معادل درک انسانی در نظر گرفته شود.
تحقیق و تدوین مهدی گمرکی
