خانه » آموزش » ترنسفورمر چیست؟ سفری از Attention تا ChatGPT

ترنسفورمر چیست؟ سفری از Attention تا ChatGPT

0

ترنسفورمر چیست و چگونه به تولد مدل‌های زبانی بزرگ و ChatGPT کمک کرد؟ با Attention، LLM، GPT و نقش Transformer در هوش مصنوعی آشنا شوید.

ترنسفورمر چیست

ترنسفورمر چیست

فصل پنجم: تفاوت یادگیری عمیق با یادگیری ماشین

قسمت چهاردهم: ترنسفورمر چیست و ChatGPT چگونه متولد شد؟

ترنسفورمر چیست ؟ قسمت چهاردهم اموزش هوش مصنوعی اختصاص دارد به این مفهوم اما قبل از ورود به این مبحث جلسه قبل را با هم مرور می کنیم.

در قسمت قبل، وارد دنیای یادگیری عمیق (Deep Learning) شدیم و دیدیم که شبکه‌های عصبی عمیق چگونه می‌توانند مسائل پیچیده‌ای مانند تشخیص تصویر، پردازش صدا و تحلیل متن را حل کنند.

تحقیق و تدوین مهدی گمرکی

با شبکه‌های کانولوشنی (CNN) آشنا شدیم که نقش مهمی در پردازش تصویر دارند و درباره شبکه‌های بازگشتی (RNN) و گونه‌هایی مانند LSTM صحبت کردیم که برای پردازش داده‌های ترتیبی، از جمله متن و صدا، مورد استفاده قرار می‌گرفتند.

اما در مسیر تکامل هوش مصنوعی، اتفاق مهمی رخ داد؛ اتفاقی که شیوه پردازش زبان توسط ماشین‌ها را تا حد زیادی تغییر داد.

این نقطه، جایی است که با مفهوم مهمی به نام Transformer یا ترنسفورمر روبه‌رو می‌شویم.

ترنسفورمر چیست؟

اگر بخواهیم خیلی ساده بگوییم، ترنسفورمر معماری‌ای در یادگیری عمیق است که برای پردازش داده‌های ترتیبی، به‌ویژه زبان، طراحی شده و مهم‌ترین ویژگی آن استفاده از مکانیزمی به نام Attention یا توجه است.

داستان ترنسفورمر در سال ۲۰۱۷ با انتشار مقاله معروف Attention Is All You Need آغاز شد؛ مقاله‌ای که توسط گروهی از پژوهشگران گوگل و همکارانشان ارائه شد.

پیش از آن، مدل‌هایی مانند RNN و LSTM برای پردازش جمله‌ها بسیار مهم بودند. این مدل‌ها معمولاً اطلاعات را به شکل ترتیبی پردازش می‌کردند؛ یعنی کلمات جمله یکی پس از دیگری وارد مدل می‌شدند.

این روش یک مشکل مهم داشت.

فرض کنید جمله‌ای بسیار طولانی داریم و در ابتدای آن درباره یک شخصیت صحبت کرده‌ایم. هرچه از جمله فاصله بگیریم، ارتباط دادن اطلاعات جدید با اطلاعات بسیار دور قبلی برای مدل دشوارتر می‌شود.

البته LSTM و مدل‌های مشابه تا حد زیادی برای حل مشکل وابستگی‌های بلندمدت طراحی شده بودند، اما پردازش ترتیبی همچنان محدودیت‌هایی از نظر سرعت آموزش و ارتباط میان بخش‌های دور متن داشت.

پژوهشگران سؤال مهمی مطرح کردند:

اگر مدل بتواند هنگام تحلیل یک کلمه، مستقیماً به بخش‌های مرتبط دیگر جمله توجه کند چه؟

اینجا بود که ایده Attention اهمیت پیدا کرد.

Attention؛ نگاه کردن به مهم‌ترین بخش جمله

برای درک بهتر، جمله زیر را تصور کنید:

«علی کتاب را برداشت چون او می‌خواست مطالعه کند.»

وقتی می‌گوییم «او»، برای درک معنای جمله باید بدانیم «او» به چه کسی اشاره می‌کند.

یک مدل زبانی باید بتواند ارتباط میان کلمات مختلف را پیدا کند.

مکانیزم Attention دقیقاً برای همین نوع ارتباط اهمیت پیدا می‌کند.

در Attention، مدل یاد می‌گیرد هنگام پردازش یک بخش از متن، به کدام بخش‌های دیگر اهمیت بیشتری بدهد.

بنابراین همه کلمات برای همه کلمات به یک اندازه مهم نیستند.

✅ بیشتر بخوانیم 👈👈👈  استلاتو G9 معرفی شد | شاسی‌بلند لوکس هواوی با برد ۱۳۶۶ کیلومتر

می‌توانیم آن را شبیه یک جلسه گروهی تصور کنیم که در آن همه افراد حضور دارند، اما وقتی یک نفر صحبت می‌کند، بیشتر به افرادی توجه می‌کند که اطلاعات مرتبط‌تری با موضوع او دارند.

در Self-Attention، هر بخش از متن می‌تواند ارتباط خود را با بخش‌های دیگر بررسی کند و میزان اهمیت این ارتباط را محاسبه کند.

به همین دلیل، مدل می‌تواند روابط میان کلمات را بسیار مؤثرتر از روش‌های صرفاً ترتیبی بررسی کند.

Transformer چه چیزی را تغییر داد؟

نوآوری اصلی Transformer فقط Attention نبود؛ بلکه این معماری نشان داد که می‌توان بخش بزرگی از پردازش متن را بدون وابستگی شدید به پردازش ترتیبی RNNها انجام داد.

این موضوع دو مزیت مهم ایجاد کرد:

اول، امکان پردازش موازی‌تر در زمان آموزش فراهم شد.

در نتیجه استفاده از سخت‌افزارهای قدرتمند برای آموزش مدل‌های بزرگ آسان‌تر شد.

دوم، مدل توانست ارتباط میان بخش‌های مختلف متن را بهتر بررسی کند.

برای مثال، در یک پاراگراف طولانی، یک کلمه می‌تواند به کلمه‌ای که بسیار دورتر قرار گرفته است توجه کند؛ البته میزان این توجه به محاسبات مدل وابسته است.

Transformer در ابتدا برای کارهایی مانند ترجمه ماشینی مطرح شد، اما خیلی زود مشخص شد که این معماری ظرفیت بسیار گسترده‌تری دارد.

و اینجا داستان تازه جذاب می‌شود.

از Transformer تا مدل‌های زبانی بزرگ

پس از معرفی Transformer، پژوهشگران از این معماری برای ساخت مدل‌های زبانی بزرگ‌تر و قدرتمندتر استفاده کردند.

اینجاست که با اصطلاح LLM یا Large Language Model روبه‌رو می‌شویم.

مدل زبانی بزرگ را می‌توان یک سیستم بسیار پیچیده دانست که با حجم عظیمی از داده‌های متنی آموزش می‌بیند و الگوهای موجود در زبان را یاد می‌گیرد.

البته این موضوع به این معنا نیست که مدل مانند یک انسان کتاب‌ها را می‌خواند و دقیقاً همان‌طور که انسان «می‌فهمد» یاد می‌گیرد.

مدل در فرایند آموزش، الگوهای آماری و روابط پیچیده میان توکن‌ها را یاد می‌گیرد.

یکی از ایده‌های مهم در آموزش بسیاری از مدل‌های زبانی این است که مدل یاد بگیرد:

«با توجه به متن قبلی، توکن بعدی چه چیزی می‌تواند باشد؟»

اگر این فرایند در مقیاس بسیار بزرگ و روی داده‌های فراوان انجام شود، مدل می‌تواند توانایی‌های پیچیده‌ای در تولید و پردازش زبان پیدا کند.

ChatGPT کجای این داستان قرار می‌گیرد؟

حالا به نامی می‌رسیم که احتمالاً بیشتر از همه شنیده‌ایم:

ChatGPT

ChatGPT را نباید با Transformer یکی بدانیم.

Transformer یک معماری است؛ در حالی که ChatGPT یک سامانه گفت‌وگویی است که بر پایه مدل‌های زبانی توسعه یافته است.

مدل‌های خانواده GPT نیز از معماری Transformer استفاده می‌کنند و برای پردازش و تولید زبان آموزش دیده‌اند.

وقتی شما در ChatGPT یک سؤال می‌نویسید، سیستم متن ورودی را پردازش می‌کند و بر اساس مدل، زمینه گفتگو و اطلاعاتی که در اختیار آن قرار گرفته است، پاسخ تولید می‌کند.

✅ بیشتر بخوانیم 👈👈👈  تفاوت یادگیری عمیق با یادگیری ماشین | آموزش Deep Learning

در ساده‌ترین تصویر ذهنی، می‌توان این مسیر را چنین تصور کرد:

متن شما ← توکن‌سازی ← پردازش توسط مدل ← محاسبه احتمال ادامه متن ← تولید پاسخ

البته در دنیای واقعی، فرایند بسیار پیچیده‌تر از این زنجیره ساده است.


یک اشتباه مهم: ChatGPT «همه چیز را نمی‌داند»

یکی از تصورات اشتباه درباره مدل‌های زبانی این است که چون مدل با حجم عظیمی از متن آموزش دیده، پس مانند یک کتابخانه بی‌نهایت اطلاعات را در ذهن خود ذخیره کرده است.

واقعیت متفاوت است.

مدل در فرایند آموزش، الگوها و روابط موجود در داده‌ها را در قالب پارامترهای بسیار زیاد یاد می‌گیرد. بنابراین پاسخ آن صرفاً «بازیابی یک صفحه از اینترنت» نیست.

به همین دلیل نیز مدل‌های زبانی ممکن است گاهی پاسخ‌هایی تولید کنند که ظاهراً درست هستند اما در واقع اشتباه‌اند.

این پدیده یکی از چالش‌های مهم مدل‌های زبانی است و در ادامه این مجموعه بیشتر با آن آشنا خواهیم شد.

از ترجمه تا ChatGPT؛ Transformer کجا استفاده می‌شود؟

قدرت Transformer فقط به ChatGPT محدود نیست.

این معماری یا گونه‌های توسعه‌یافته آن در طیف گسترده‌ای از کاربردهای هوش مصنوعی استفاده شده‌اند؛ از جمله:

  • ترجمه ماشینی
  • تولید و خلاصه‌سازی متن
  • پاسخ‌گویی به پرسش‌ها
  • تولید کد
  • تحلیل و دسته‌بندی متن
  • مدل‌های چندوجهی
  • پردازش تصویر و ویدئو در برخی معماری‌های جدید

حتی امروز مرز میان مدل‌های متن، تصویر، صدا و ویدئو نیز در حال کم‌رنگ‌تر شدن است و مدل‌های چندوجهی تلاش می‌کنند انواع مختلف داده را در یک سیستم واحد پردازش کنند.

بنابراین Transformer را می‌توان یکی از مهم‌ترین قطعات پازل تحول هوش مصنوعی مدرن دانست.

یک تصویر ذهنی ساده از Transformer

برای اینکه تمام این مفاهیم را در ذهنمان نگه داریم، یک مثال ساده داشته باشیم.

فرض کنید روی میز، قطعات یک پازل بزرگ ریخته شده‌اند.

یک روش این است که قطعات را یکی‌یکی بررسی کنیم و هر بار فقط با قطعه قبلی ارتباط برقرار کنیم.

اما روش دیگر این است که بتوانیم هنگام بررسی هر قطعه، به تعداد زیادی از قطعات دیگر نگاه کنیم و ارتباط میان آن‌ها را پیدا کنیم.

Attention تقریباً چنین ایده‌ای را وارد پردازش زبان کرد.

Transformer نیز معماری‌ای را فراهم کرد که این ایده را در مقیاس بزرگ به کار بگیرد.

به همین دلیل است که وقتی امروز از مدل‌های زبانی بزرگ، ابزارهای تولید محتوا، دستیارهای هوشمند و بسیاری از سامانه‌های مولد صحبت می‌کنیم، نام Transformer بارها شنیده می‌شود.

از یادگیری ماشین تا هوش مصنوعی مولد

اگر مسیر این مجموعه را از ابتدا دنبال کرده باشید، حالا می‌توانیم قطعات مختلف را کنار هم بگذاریم.

در ابتدا با یادگیری ماشین آشنا شدیم؛ جایی که الگوریتم‌ها از داده‌ها الگو یاد می‌گرفتند.

بعد وارد یادگیری عمیق شدیم؛ جایی که شبکه‌های عصبی عمیق توانستند نمایش‌های پیچیده‌تری از داده‌ها یاد بگیرند.

سپس با CNN برای پردازش تصویر و RNN/LSTM برای داده‌های ترتیبی آشنا شدیم.

✅ بیشتر بخوانیم 👈👈👈  رشته در پایتون؛ آموزش Indexing و Slicing با مثال | جلسه ۱۱

حالا به Transformer رسیدیم؛ معماری‌ای که مسیر توسعه بسیاری از مدل‌های زبانی بزرگ و سامانه‌های هوش مصنوعی مولد امروزی را تغییر داد.

اما داستان هنوز تمام نشده است.

قسمت بعد: وقتی هوش مصنوعی فقط متن تولید نمی‌کند

تا اینجا بیشتر درباره متن صحبت کردیم.

اما اگر یک مدل بتواند متن را تولید کند، آیا می‌تواند تصویر هم بسازد؟

آیا می‌توان به یک سیستم گفت:

«یک شهر آینده‌نگر در شب، با ساختمان‌های شیشه‌ای و خودروهای پرنده بساز»

و سیستم واقعاً یک تصویر تولید کند؟

پاسخ این سؤال ما را وارد دنیای مدل‌های مولد تصویر و هوش مصنوعی چندوجهی می‌کند.

در قسمت پانزدهم، از دنیای مدل‌های زبانی عبور می‌کنیم و به سراغ مدل‌های تصویری می‌رویم؛ جایی که ابزارهایی مانند DALL·E نشان می‌دهند هوش مصنوعی چگونه می‌تواند از یک توضیح متنی، تصویر تولید کند.

سفر ما از «فهمیدن متن» به «ساختن جهان‌های جدید» ادامه دارد.

جمع‌بندی قسمت چهاردهم

اگر بخواهیم کل این قسمت را در چند جمله خلاصه کنیم:

Transformer یک معماری مهم در یادگیری عمیق است که Attention را به شکل قدرتمندی برای بررسی ارتباط میان بخش‌های مختلف داده به کار می‌گیرد.

این معماری در سال ۲۰۱۷ معرفی شد و بعدها پایه بسیاری از مدل‌های زبانی بزرگ قرار گرفت.

مدل‌های خانواده GPT نیز بر پایه معماری Transformer توسعه یافته‌اند و ChatGPT یک سامانه گفت‌وگویی مبتنی بر مدل‌های زبانی است.

بنابراین زنجیره مفهومی این قسمت را می‌توان این‌طور به خاطر سپرد:

Attention ← Transformer ← مدل‌های زبانی بزرگ ← GPT ← ChatGPT

البته این زنجیره برای ساده‌سازی آموزشی است و در واقعیت، مسیر توسعه این فناوری‌ها بسیار پیچیده‌تر است.

پرسش‌های متداول

ترنسفورمر چیست؟

Transformer یک معماری یادگیری عمیق است که از مکانیزم‌هایی مانند Self-Attention برای یادگیری ارتباط میان بخش‌های مختلف داده استفاده می‌کند و نقش مهمی در توسعه مدل‌های زبانی مدرن دارد.

آیا ChatGPT همان Transformer است؟

خیر. Transformer یک معماری است، اما ChatGPT یک سامانه گفت‌وگویی است که از مدل‌های زبانی مبتنی بر معماری Transformer استفاده می‌کند.

Attention در هوش مصنوعی چه کاری انجام می‌دهد؟

Attention به مدل کمک می‌کند هنگام پردازش یک بخش از داده، اهمیت بخش‌های مرتبط دیگر را محاسبه کند و ارتباط میان آن‌ها را بهتر در نظر بگیرد.

چرا Transformer مهم است؟

Transformer امکان آموزش کارآمدتر مدل‌های بزرگ و یادگیری ارتباط‌های پیچیده میان بخش‌های مختلف داده را فراهم کرد و به یکی از پایه‌های مهم هوش مصنوعی مولد و مدل‌های زبانی بزرگ تبدیل شد.

LLM چیست؟

LLM مخفف Large Language Model یا «مدل زبانی بزرگ» است؛ مدلی که با حجم زیادی از داده‌های متنی آموزش داده می‌شود تا بتواند وظایف مختلف مرتبط با زبان، مانند تولید و تحلیل متن، را انجام دهد.

تحقیق و تدوین مهدی گمرکی

مشاوره تجارت الکترونیکی

دیدگاهتان را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *

برای ثبت نظر عبارت ریاضی را وارد کنید! *در حال بارگذاری کپچا...