خانه » آموزش » تولید تصویر با هوش مصنوعی؛ از متن تا تصویر | قسمت ۱۵

تولید تصویر با هوش مصنوعی؛ از متن تا تصویر | قسمت ۱۵

0
تولید تصویر با هوش مصنوعی

تولید تصویر با هوش مصنوعی

قسمت پانزدهم: تولید تصویر با هوش مصنوعی؛ وقتی متن به تصویر تبدیل می‌شود

تولید تصویر با هوش مصنوعی چگونه انجام می‌شود؟ با هوش مصنوعی مولد، مدل‌های انتشار، Prompt، DALL·E و مسیر تبدیل متن به تصویر آشنا شوید.

تحقیق و تدوین مهدی گمرکی

در قسمت چهاردهم، به یکی از مهم‌ترین نقاط تحول هوش مصنوعی رسیدیم؛ جایی که درباره Transformer، مفهوم Attention و مدل‌های زبانی بزرگ یا LLM صحبت کردیم.

دیدیم که چگونه معماری Transformer به مدل‌های زبانی کمک کرد ارتباط میان بخش‌های مختلف متن را بهتر یاد بگیرند و در نهایت، فناوری‌هایی مانند GPT و ChatGPT به وجود آمدند.

اما یک سؤال جذاب باقی می‌ماند:

اگر هوش مصنوعی می‌تواند از روی متن، متن جدید تولید کند، آیا می‌تواند از روی متن، تصویر هم بسازد؟

مثلاً اگر به یک هوش مصنوعی بگوییم:

«یک شهر آینده‌نگر در شب، با ساختمان‌های شیشه‌ای، خودروهای پرنده و نورهای نئونی ایجاد کن.»

آیا واقعاً می‌تواند چنین تصویری بسازد؟

اینجاست که وارد دنیای تولید تصویر با هوش مصنوعی می‌شویم.

هوش مصنوعی مولد چیست؟

قبل از اینکه سراغ تولید تصویر برویم، باید با یک مفهوم مهم آشنا شویم:

هوش مصنوعی مولد یا Generative AI

مدل‌های سنتی هوش مصنوعی معمولاً برای کارهایی مانند تشخیص، دسته‌بندی یا پیش‌بینی استفاده می‌شدند.

مثلاً یک مدل می‌توانست به یک تصویر نگاه کند و بگوید:

«این تصویر یک گربه است.»

اما مدل مولد می‌تواند یک قدم فراتر برود.

به جای اینکه فقط تصویر را تشخیص دهد، می‌تواند:

«یک تصویر جدید از یک گربه ایجاد کند.»

همین تفاوت، دنیای جدیدی را به وجود آورد.

در هوش مصنوعی مولد، هدف فقط پیدا کردن پاسخ در داده‌های قبلی نیست؛ بلکه مدل تلاش می‌کند بر اساس الگوهایی که در فرایند آموزش یاد گرفته، محتوای جدید تولید کند.

این محتوا می‌تواند متن، تصویر، صدا، ویدئو یا حتی کد باشد.

تولید تصویر با هوش مصنوعی چگونه کار می‌کند؟

تولید تصویر با هوش مصنوعی چگونه کار می‌کند؟

حالا سؤال اصلی:

یک ماشین چگونه از چند کلمه، یک تصویر تولید می‌کند؟

برای درک ساده موضوع، فرض کنید شما به یک مدل می‌گویید:

«یک ربات در حال قدم زدن در تهران آینده‌نگر.»

مدل باید چند مفهوم را از این جمله استخراج کند:

🤖 ربات
🚶 در حال قدم زدن
🏙️ شهر
🇮🇷 تهران
🔮 فضای آینده‌نگر

اما کار همین‌جا تمام نمی‌شود.

مدل باید یاد بگیرد این مفاهیم چگونه باید در یک تصویر با یکدیگر ارتباط داشته باشند.

ربات کجا قرار بگیرد؟

ساختمان‌ها چه شکلی باشند؟

نورپردازی چگونه باشد؟

زاویه دوربین چطور انتخاب شود؟

و مهم‌تر از همه:

چگونه تمام این مفاهیم در یک تصویر واحد کنار هم قرار بگیرند؟

مدل تصویر را مثل یک نقاش انسان نمی‌کشد

یک تصور اشتباه این است که مدل هوش مصنوعی مانند یک نقاش دیجیتال، ابتدا سر ربات را می‌کشد، سپس بدن آن را اضافه می‌کند و در پایان پس‌زمینه را می‌سازد.

در بسیاری از مدل‌های مدرن تولید تصویر، فرایند به این شکل ساده نیست.

یکی از رویکردهای بسیار مهم در این حوزه، مدل‌های انتشار یا Diffusion Models هستند.

✅ بیشتر بخوانیم 👈👈👈  تفاوت یادگیری عمیق با یادگیری ماشین | آموزش Deep Learning

برای درک ایده آن‌ها، یک آزمایش ذهنی انجام دهیم.

فرض کنید تصویر یک گربه را داریم و کم‌کم روی آن نویز اضافه می‌کنیم.

در ابتدا:

🐱 تصویر کاملاً واضح است.

بعد:

🐱 → 🌫️

تصویر کمی خراب می‌شود.

دوباره نویز اضافه می‌کنیم:

🌫️ → 🌫️

تا جایی که در نهایت، تصویر تقریباً به یک توده نویز تبدیل می‌شود.

حالا مدل یاد می‌گیرد این فرایند را برعکس انجام دهد.

یعنی از نویز شروع کند و مرحله‌به‌مرحله تصویری معنادار ایجاد کند.

از نویز تا تصویر

اینجا یکی از جذاب‌ترین ایده‌های تولید تصویر با هوش مصنوعی شکل می‌گیرد.

مدل می‌تواند از یک وضعیت شبیه نویز شروع کند و طی چند مرحله، آن را به تصویری تبدیل کند که با درخواست کاربر هماهنگ باشد.

به شکل ساده:

نویز >>> شکل‌های اولیه >>> جزئیات >>> تصویر نهایی

البته در مدل‌های واقعی، این فرایند بسیار پیچیده‌تر است و از شبکه‌های عصبی، نمایش‌های فشرده تصویر و سازوکارهای مختلف برای هدایت تولید استفاده می‌شود.

اما برای یادگیری مفهومی، همین تصویر ذهنی کافی است:

هوش مصنوعی از آشفتگی شروع می‌کند و به سمت ساختاری معنادار حرکت می‌کند.

متن چگونه به تصویر دستور می‌دهد؟

حالا بخش جالب ماجرا:

مدل از کجا می‌فهمد شما نوشته‌اید:

«یک گربه سفید روی ماه، در سبک سینمایی»؟

اینجا دوباره به دنیای زبان و ارتباط میان متن و تصویر برمی‌گردیم.

سیستم باید متن شما را به شکلی تبدیل کند که مدل بتواند ارتباط آن را با ویژگی‌های تصویری درک کند.

در بسیاری از سامانه‌های مدرن، یک بخش متن را به نمایش عددی یا Embedding تبدیل می‌کند.

در طرف دیگر، تصویر نیز می‌تواند در یک فضای عددی نمایش داده شود.

مدل تلاش می‌کند ارتباط میان این دو فضا را یاد بگیرد:

متن ↔ مفهوم ↔ ویژگی‌های تصویری

به همین دلیل است که مدل می‌تواند بفهمد «گربه سفید» با «گربه سیاه» تفاوت دارد یا «شب» با «روز» یک مفهوم نیست.

DALL·E چه نقشی در این داستان دارد؟

در مسیر پیشرفت مدل‌های تولید تصویر، نام DALL·E بسیار مشهور شد.

DALL·E نمونه‌ای از سیستم‌هایی است که نشان دادند می‌توان از توضیحات متنی برای تولید تصاویر استفاده کرد.

یعنی به جای اینکه کاربر با نرم‌افزارهای پیچیده طراحی کار کند، می‌تواند ایده خود را با زبان طبیعی توضیح دهد.

مثلاً:

«یک خانه کوچک چوبی در میان جنگل، در یک صبح مه‌آلود پاییزی.»

و مدل تلاش می‌کند تصویری متناسب با این توصیف ایجاد کند.

این اتفاق یک تغییر مهم در رابطه انسان و کامپیوتر بود.

تا قبل از آن، برای ایجاد یک تصویر باید ابزارهای طراحی، مهارت‌های گرافیکی و زمان زیادی در اختیار داشتیم.

اما هوش مصنوعی مولد یک رابط جدید معرفی کرد:

زبان انسان → محتوا

Prompt چیست؟

وقتی با ابزارهای تولید تصویر کار می‌کنیم، احتمالاً با واژه‌ای به نام Prompt یا پرامپت مواجه می‌شویم.

پرامپت همان دستوری است که به مدل می‌دهیم.

مثلاً:

پرامپت ساده:

«یک ربات در شهر.»

اما می‌توانیم آن را دقیق‌تر کنیم:

«یک ربات انسان‌نما در خیابان‌های یک شهر آینده‌نگر، شب، نورهای نئونی، باران، نمای سینمایی، جزئیات بسیار زیاد.»

✅ بیشتر بخوانیم 👈👈👈  عملگرهای منطقی در پایتون؛ آموزش and، or و not

هرچه توصیف دقیق‌تر باشد، اطلاعات بیشتری درباره نتیجه مورد انتظار در اختیار مدل قرار می‌گیرد.

البته یک پرامپت طولانی لزوماً همیشه بهتر نیست؛ مهم‌تر از طول پرامپت، شفافیت و ساختار آن است.

آیا هوش مصنوعی واقعاً تصویر را می‌فهمد؟

اینجا باید یک نکته مهم را به خاطر بسپاریم.

وقتی می‌گوییم مدل «می‌فهمد» که یک گربه چیست، نباید این عبارت را دقیقاً مانند فهم انسان تفسیر کنیم.

مدل بر اساس داده‌های آموزشی، الگوها و روابط آماری بسیار پیچیده‌ای را یاد گرفته است.

اگر میلیون‌ها نمونه تصویر و توضیح متنی مرتبط با گربه‌ها در داده‌های آموزشی وجود داشته باشد، مدل می‌تواند الگوهایی مربوط به شکل بدن، گوش‌ها، چشم‌ها، موها و سایر ویژگی‌ها را یاد بگیرد.

بنابراین وقتی شما می‌گویید:

«یک گربه سفید»

مدل بر اساس روابط آموخته‌شده تلاش می‌کند تصویری تولید کند که با این مفهوم سازگار باشد.

چرا گاهی دست‌های عجیب می‌بینیم؟

احتمالاً تصاویر تولیدشده توسط هوش مصنوعی را دیده‌اید که در آن‌ها:

✋ تعداد انگشت‌ها اشتباه است.

👁️ چشم‌ها نامتقارن‌اند.

📝 نوشته‌های روی تصویر ناخوانا هستند.

🚗 جزئیات اشیا عجیب به نظر می‌رسند.

دلیل این اتفاق آن است که تولید تصویر، یک فرایند ساده کپی‌کردن از نمونه‌های آموزشی نیست.

مدل باید ساختارهای پیچیده‌ای را ایجاد کند و گاهی در بازسازی جزئیات دقیق دچار خطا می‌شود.

البته کیفیت مدل‌های تولید تصویر در سال‌های اخیر به شکل چشمگیری افزایش یافته و بسیاری از این مشکلات در مدل‌های جدید کمتر شده‌اند؛ اما همچنان نمی‌توان گفت تولید تصویر همیشه بدون خطا است.

Transformer و مدل‌های تصویری چه ارتباطی دارند؟

حالا سؤال مهمی که از قسمت قبل باقی مانده بود:

اگر Transformer برای زبان مهم است، آیا فقط در زبان کاربرد دارد؟

خیر.

ایده‌های Transformer به حوزه‌های دیگری نیز راه پیدا کرده‌اند.

امروزه معماری‌ها و روش‌های مبتنی بر Transformer در حوزه‌هایی مانند:

  • متن
  • تصویر
  • صدا
  • ویدئو
  • مدل‌های چندوجهی

به کار گرفته می‌شوند.

از طرف دیگر، مدل‌های انتشار نیز نقش بسیار مهمی در پیشرفت تولید تصویر داشته‌اند.

بنابراین دنیای هوش مصنوعی مدرن فقط یک معماری یا یک الگوریتم واحد نیست؛ بلکه مجموعه‌ای از ایده‌ها و معماری‌هاست که در کنار یکدیگر تکامل پیدا کرده‌اند.

از متن و تصویر تا هوش مصنوعی چندوجهی

حالا تصور کنید مدلی داشته باشیم که فقط متن را پردازش نکند.

بلکه بتواند:

📖 متن را بخواند
🖼️ تصویر را ببیند
🎙️ صدا را بشنود
🎥 ویدئو را تحلیل کند
💬 پاسخ تولید کند

اینجاست که به مفهوم هوش مصنوعی چندوجهی یا Multimodal AI می‌رسیم.

برای مثال، شما تصویری از یک موتور خودرو را به یک مدل می‌دهید و از آن می‌خواهید:

«این تصویر را بررسی کن و توضیح بده کدام بخش‌ها را می‌بینی.»

مدل باید بتواند اطلاعات تصویری و زبانی را در یک فرایند مشترک پردازش کند.

این دقیقاً همان مسیری است که هوش مصنوعی در حال حرکت به سمت آن است.

یک انقلاب جدید در راه است

اگر تا چند سال پیش برای ساخت یک تصویر باید ساعت‌ها با نرم‌افزارهای گرافیکی کار می‌کردیم، امروز می‌توانیم ایده خود را با چند جمله توصیف کنیم.

✅ بیشتر بخوانیم 👈👈👈  تأثیر خواب بر عملکرد تحصیلی نوجوانان | خواب و موفقیت تحصیلی

اما این تنها یک تغییر در طراحی نیست.

رابط انسان و ماشین در حال تغییر است.

در گذشته:

انسان → ابزار → دستورهای پیچیده → نتیجه

اما در بسیاری از ابزارهای هوش مصنوعی مولد:

انسان → زبان طبیعی → هوش مصنوعی → نتیجه

ما کم‌کم در حال حرکت از «کار کردن با نرم‌افزار» به سمت «گفتگو با نرم‌افزار» هستیم.

و این تغییر، یکی از مهم‌ترین اتفاقات عصر هوش مصنوعی است.

قسمت بعد چه می‌شود؟

تا اینجا سه دنیای مهم را دیدیم:

🧠 یادگیری ماشین

⬇️

🤖 یادگیری عمیق

⬇️

هوش مصنوعی مولد

اما هنوز یک سؤال بزرگ باقی مانده است:

اگر هوش مصنوعی بتواند متن و تصویر تولید کند، آیا می‌تواند صدا و ویدئو هم بسازد؟

آیا می‌توان به یک مدل گفت:

«یک شخصیت را در حال صحبت کردن نشان بده»

و چند لحظه بعد، یک ویدئوی واقعی دریافت کرد؟

در قسمت شانزدهم، وارد دنیای تولید صدا و ویدئو با هوش مصنوعی می‌شویم؛ جایی که مرز میان واقعیت و محتوای تولیدشده توسط ماشین روزبه‌روز باریک‌تر می‌شود.

جمع‌بندی قسمت پانزدهم

در این قسمت یاد گرفتیم که:

  • 🔹 هوش مصنوعی مولد می‌تواند محتوای جدید تولید کند.
  • 🔹 مدل‌های تولید تصویر می‌توانند از توضیحات متنی برای ساخت تصویر استفاده کنند.
  • 🔹 Diffusion Models یکی از رویکردهای مهم در تولید تصویر هستند.
  • 🔹 مدل می‌تواند فرایند تولید را از نویز به سمت یک تصویر معنادار هدایت کند.
  • 🔹 Prompt دستور یا توضیحی است که برای هدایت مدل استفاده می‌کنیم.
  • 🔹 DALL·E یکی از نمونه‌های شناخته‌شده در مسیر توسعه تولید تصویر از متن است.
  • 🔹 آینده هوش مصنوعی به سمت مدل‌های چندوجهی حرکت می‌کند؛ مدل‌هایی که می‌توانند انواع مختلف داده مانند متن، تصویر، صدا و ویدئو را پردازش کنند.

و شاید مهم‌ترین نکته این باشد:

ما دیگر فقط از هوش مصنوعی برای شناخت جهان استفاده نمی‌کنیم؛ حالا می‌توانیم از آن بخواهیم جهان‌های جدیدی بسازد.

پرسش‌های متداول

تولید تصویر با هوش مصنوعی چیست؟

تولید تصویر با هوش مصنوعی به فرایندی گفته می‌شود که در آن یک مدل یادگیری ماشین می‌تواند بر اساس دستور یا شرایط مشخص، تصویر جدید تولید کند.

Diffusion Model چیست؟

مدل انتشار یا Diffusion Model یکی از رویکردهای مهم برای تولید محتواست که در بسیاری از مدل‌های تولید تصویر استفاده شده و ایده اصلی آن، یادگیری فرایند تبدیل نویز به داده معنادار است.

Prompt در تولید تصویر چیست؟

Prompt متنی است که کاربر برای توضیح تصویر موردنظر خود به مدل می‌دهد و مدل از آن برای هدایت فرایند تولید استفاده می‌کند.

آیا DALL·E یک مدل تولید تصویر است؟

DALL·E نام خانواده‌ای از مدل‌های تولید تصویر از متن است که برای ایجاد تصاویر بر اساس توضیحات متنی توسعه یافته‌اند.

آیا هوش مصنوعی واقعاً تصویر را می‌فهمد؟

مدل‌های هوش مصنوعی الگوها و روابط پیچیده موجود در داده‌های آموزشی را یاد می‌گیرند. استفاده از واژه «فهمیدن» برای آن‌ها یک ساده‌سازی آموزشی است و نباید دقیقاً معادل درک انسانی در نظر گرفته شود.

تحقیق و تدوین مهدی گمرکی

مشاوره تجارت الکترونیکی

دیدگاهتان را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *

برای ثبت نظر عبارت ریاضی را وارد کنید! *در حال بارگذاری کپچا...