ترنسفورمر چیست؟ سفری از Attention تا ChatGPT
ترنسفورمر چیست و چگونه به تولد مدلهای زبانی بزرگ و ChatGPT کمک کرد؟ با Attention، LLM، GPT و نقش Transformer در هوش مصنوعی آشنا شوید.
ترنسفورمر چیست
فصل پنجم: تفاوت یادگیری عمیق با یادگیری ماشین
قسمت چهاردهم: ترنسفورمر چیست و ChatGPT چگونه متولد شد؟
ترنسفورمر چیست ؟ قسمت چهاردهم اموزش هوش مصنوعی اختصاص دارد به این مفهوم اما قبل از ورود به این مبحث جلسه قبل را با هم مرور می کنیم.
در قسمت قبل، وارد دنیای یادگیری عمیق (Deep Learning) شدیم و دیدیم که شبکههای عصبی عمیق چگونه میتوانند مسائل پیچیدهای مانند تشخیص تصویر، پردازش صدا و تحلیل متن را حل کنند.
تحقیق و تدوین مهدی گمرکی
با شبکههای کانولوشنی (CNN) آشنا شدیم که نقش مهمی در پردازش تصویر دارند و درباره شبکههای بازگشتی (RNN) و گونههایی مانند LSTM صحبت کردیم که برای پردازش دادههای ترتیبی، از جمله متن و صدا، مورد استفاده قرار میگرفتند.
اما در مسیر تکامل هوش مصنوعی، اتفاق مهمی رخ داد؛ اتفاقی که شیوه پردازش زبان توسط ماشینها را تا حد زیادی تغییر داد.
این نقطه، جایی است که با مفهوم مهمی به نام Transformer یا ترنسفورمر روبهرو میشویم.
ترنسفورمر چیست؟
اگر بخواهیم خیلی ساده بگوییم، ترنسفورمر معماریای در یادگیری عمیق است که برای پردازش دادههای ترتیبی، بهویژه زبان، طراحی شده و مهمترین ویژگی آن استفاده از مکانیزمی به نام Attention یا توجه است.
داستان ترنسفورمر در سال ۲۰۱۷ با انتشار مقاله معروف Attention Is All You Need آغاز شد؛ مقالهای که توسط گروهی از پژوهشگران گوگل و همکارانشان ارائه شد.
پیش از آن، مدلهایی مانند RNN و LSTM برای پردازش جملهها بسیار مهم بودند. این مدلها معمولاً اطلاعات را به شکل ترتیبی پردازش میکردند؛ یعنی کلمات جمله یکی پس از دیگری وارد مدل میشدند.
این روش یک مشکل مهم داشت.
فرض کنید جملهای بسیار طولانی داریم و در ابتدای آن درباره یک شخصیت صحبت کردهایم. هرچه از جمله فاصله بگیریم، ارتباط دادن اطلاعات جدید با اطلاعات بسیار دور قبلی برای مدل دشوارتر میشود.
البته LSTM و مدلهای مشابه تا حد زیادی برای حل مشکل وابستگیهای بلندمدت طراحی شده بودند، اما پردازش ترتیبی همچنان محدودیتهایی از نظر سرعت آموزش و ارتباط میان بخشهای دور متن داشت.
پژوهشگران سؤال مهمی مطرح کردند:
اگر مدل بتواند هنگام تحلیل یک کلمه، مستقیماً به بخشهای مرتبط دیگر جمله توجه کند چه؟
اینجا بود که ایده Attention اهمیت پیدا کرد.
Attention؛ نگاه کردن به مهمترین بخش جمله
برای درک بهتر، جمله زیر را تصور کنید:
«علی کتاب را برداشت چون او میخواست مطالعه کند.»
وقتی میگوییم «او»، برای درک معنای جمله باید بدانیم «او» به چه کسی اشاره میکند.
یک مدل زبانی باید بتواند ارتباط میان کلمات مختلف را پیدا کند.
مکانیزم Attention دقیقاً برای همین نوع ارتباط اهمیت پیدا میکند.
در Attention، مدل یاد میگیرد هنگام پردازش یک بخش از متن، به کدام بخشهای دیگر اهمیت بیشتری بدهد.
بنابراین همه کلمات برای همه کلمات به یک اندازه مهم نیستند.
میتوانیم آن را شبیه یک جلسه گروهی تصور کنیم که در آن همه افراد حضور دارند، اما وقتی یک نفر صحبت میکند، بیشتر به افرادی توجه میکند که اطلاعات مرتبطتری با موضوع او دارند.
در Self-Attention، هر بخش از متن میتواند ارتباط خود را با بخشهای دیگر بررسی کند و میزان اهمیت این ارتباط را محاسبه کند.
به همین دلیل، مدل میتواند روابط میان کلمات را بسیار مؤثرتر از روشهای صرفاً ترتیبی بررسی کند.
Transformer چه چیزی را تغییر داد؟
نوآوری اصلی Transformer فقط Attention نبود؛ بلکه این معماری نشان داد که میتوان بخش بزرگی از پردازش متن را بدون وابستگی شدید به پردازش ترتیبی RNNها انجام داد.
این موضوع دو مزیت مهم ایجاد کرد:
اول، امکان پردازش موازیتر در زمان آموزش فراهم شد.
در نتیجه استفاده از سختافزارهای قدرتمند برای آموزش مدلهای بزرگ آسانتر شد.
دوم، مدل توانست ارتباط میان بخشهای مختلف متن را بهتر بررسی کند.
برای مثال، در یک پاراگراف طولانی، یک کلمه میتواند به کلمهای که بسیار دورتر قرار گرفته است توجه کند؛ البته میزان این توجه به محاسبات مدل وابسته است.
Transformer در ابتدا برای کارهایی مانند ترجمه ماشینی مطرح شد، اما خیلی زود مشخص شد که این معماری ظرفیت بسیار گستردهتری دارد.
و اینجا داستان تازه جذاب میشود.
از Transformer تا مدلهای زبانی بزرگ
پس از معرفی Transformer، پژوهشگران از این معماری برای ساخت مدلهای زبانی بزرگتر و قدرتمندتر استفاده کردند.
اینجاست که با اصطلاح LLM یا Large Language Model روبهرو میشویم.
مدل زبانی بزرگ را میتوان یک سیستم بسیار پیچیده دانست که با حجم عظیمی از دادههای متنی آموزش میبیند و الگوهای موجود در زبان را یاد میگیرد.
البته این موضوع به این معنا نیست که مدل مانند یک انسان کتابها را میخواند و دقیقاً همانطور که انسان «میفهمد» یاد میگیرد.
مدل در فرایند آموزش، الگوهای آماری و روابط پیچیده میان توکنها را یاد میگیرد.
یکی از ایدههای مهم در آموزش بسیاری از مدلهای زبانی این است که مدل یاد بگیرد:
«با توجه به متن قبلی، توکن بعدی چه چیزی میتواند باشد؟»
اگر این فرایند در مقیاس بسیار بزرگ و روی دادههای فراوان انجام شود، مدل میتواند تواناییهای پیچیدهای در تولید و پردازش زبان پیدا کند.
ChatGPT کجای این داستان قرار میگیرد؟
حالا به نامی میرسیم که احتمالاً بیشتر از همه شنیدهایم:
ChatGPT
ChatGPT را نباید با Transformer یکی بدانیم.
Transformer یک معماری است؛ در حالی که ChatGPT یک سامانه گفتوگویی است که بر پایه مدلهای زبانی توسعه یافته است.
مدلهای خانواده GPT نیز از معماری Transformer استفاده میکنند و برای پردازش و تولید زبان آموزش دیدهاند.
وقتی شما در ChatGPT یک سؤال مینویسید، سیستم متن ورودی را پردازش میکند و بر اساس مدل، زمینه گفتگو و اطلاعاتی که در اختیار آن قرار گرفته است، پاسخ تولید میکند.
در سادهترین تصویر ذهنی، میتوان این مسیر را چنین تصور کرد:
متن شما ← توکنسازی ← پردازش توسط مدل ← محاسبه احتمال ادامه متن ← تولید پاسخ
البته در دنیای واقعی، فرایند بسیار پیچیدهتر از این زنجیره ساده است.
یک اشتباه مهم: ChatGPT «همه چیز را نمیداند»
یکی از تصورات اشتباه درباره مدلهای زبانی این است که چون مدل با حجم عظیمی از متن آموزش دیده، پس مانند یک کتابخانه بینهایت اطلاعات را در ذهن خود ذخیره کرده است.
واقعیت متفاوت است.
مدل در فرایند آموزش، الگوها و روابط موجود در دادهها را در قالب پارامترهای بسیار زیاد یاد میگیرد. بنابراین پاسخ آن صرفاً «بازیابی یک صفحه از اینترنت» نیست.
به همین دلیل نیز مدلهای زبانی ممکن است گاهی پاسخهایی تولید کنند که ظاهراً درست هستند اما در واقع اشتباهاند.
این پدیده یکی از چالشهای مهم مدلهای زبانی است و در ادامه این مجموعه بیشتر با آن آشنا خواهیم شد.
از ترجمه تا ChatGPT؛ Transformer کجا استفاده میشود؟
قدرت Transformer فقط به ChatGPT محدود نیست.
این معماری یا گونههای توسعهیافته آن در طیف گستردهای از کاربردهای هوش مصنوعی استفاده شدهاند؛ از جمله:
- ترجمه ماشینی
- تولید و خلاصهسازی متن
- پاسخگویی به پرسشها
- تولید کد
- تحلیل و دستهبندی متن
- مدلهای چندوجهی
- پردازش تصویر و ویدئو در برخی معماریهای جدید
حتی امروز مرز میان مدلهای متن، تصویر، صدا و ویدئو نیز در حال کمرنگتر شدن است و مدلهای چندوجهی تلاش میکنند انواع مختلف داده را در یک سیستم واحد پردازش کنند.
بنابراین Transformer را میتوان یکی از مهمترین قطعات پازل تحول هوش مصنوعی مدرن دانست.
یک تصویر ذهنی ساده از Transformer
برای اینکه تمام این مفاهیم را در ذهنمان نگه داریم، یک مثال ساده داشته باشیم.
فرض کنید روی میز، قطعات یک پازل بزرگ ریخته شدهاند.
یک روش این است که قطعات را یکییکی بررسی کنیم و هر بار فقط با قطعه قبلی ارتباط برقرار کنیم.
اما روش دیگر این است که بتوانیم هنگام بررسی هر قطعه، به تعداد زیادی از قطعات دیگر نگاه کنیم و ارتباط میان آنها را پیدا کنیم.
Attention تقریباً چنین ایدهای را وارد پردازش زبان کرد.
Transformer نیز معماریای را فراهم کرد که این ایده را در مقیاس بزرگ به کار بگیرد.
به همین دلیل است که وقتی امروز از مدلهای زبانی بزرگ، ابزارهای تولید محتوا، دستیارهای هوشمند و بسیاری از سامانههای مولد صحبت میکنیم، نام Transformer بارها شنیده میشود.
از یادگیری ماشین تا هوش مصنوعی مولد
اگر مسیر این مجموعه را از ابتدا دنبال کرده باشید، حالا میتوانیم قطعات مختلف را کنار هم بگذاریم.
در ابتدا با یادگیری ماشین آشنا شدیم؛ جایی که الگوریتمها از دادهها الگو یاد میگرفتند.
بعد وارد یادگیری عمیق شدیم؛ جایی که شبکههای عصبی عمیق توانستند نمایشهای پیچیدهتری از دادهها یاد بگیرند.
سپس با CNN برای پردازش تصویر و RNN/LSTM برای دادههای ترتیبی آشنا شدیم.
حالا به Transformer رسیدیم؛ معماریای که مسیر توسعه بسیاری از مدلهای زبانی بزرگ و سامانههای هوش مصنوعی مولد امروزی را تغییر داد.
اما داستان هنوز تمام نشده است.
قسمت بعد: وقتی هوش مصنوعی فقط متن تولید نمیکند
تا اینجا بیشتر درباره متن صحبت کردیم.
اما اگر یک مدل بتواند متن را تولید کند، آیا میتواند تصویر هم بسازد؟
آیا میتوان به یک سیستم گفت:
«یک شهر آیندهنگر در شب، با ساختمانهای شیشهای و خودروهای پرنده بساز»
و سیستم واقعاً یک تصویر تولید کند؟
پاسخ این سؤال ما را وارد دنیای مدلهای مولد تصویر و هوش مصنوعی چندوجهی میکند.
در قسمت پانزدهم، از دنیای مدلهای زبانی عبور میکنیم و به سراغ مدلهای تصویری میرویم؛ جایی که ابزارهایی مانند DALL·E نشان میدهند هوش مصنوعی چگونه میتواند از یک توضیح متنی، تصویر تولید کند.
سفر ما از «فهمیدن متن» به «ساختن جهانهای جدید» ادامه دارد.
جمعبندی قسمت چهاردهم
اگر بخواهیم کل این قسمت را در چند جمله خلاصه کنیم:
Transformer یک معماری مهم در یادگیری عمیق است که Attention را به شکل قدرتمندی برای بررسی ارتباط میان بخشهای مختلف داده به کار میگیرد.
این معماری در سال ۲۰۱۷ معرفی شد و بعدها پایه بسیاری از مدلهای زبانی بزرگ قرار گرفت.
مدلهای خانواده GPT نیز بر پایه معماری Transformer توسعه یافتهاند و ChatGPT یک سامانه گفتوگویی مبتنی بر مدلهای زبانی است.
بنابراین زنجیره مفهومی این قسمت را میتوان اینطور به خاطر سپرد:
Attention ← Transformer ← مدلهای زبانی بزرگ ← GPT ← ChatGPT
البته این زنجیره برای سادهسازی آموزشی است و در واقعیت، مسیر توسعه این فناوریها بسیار پیچیدهتر است.
پرسشهای متداول
ترنسفورمر چیست؟
Transformer یک معماری یادگیری عمیق است که از مکانیزمهایی مانند Self-Attention برای یادگیری ارتباط میان بخشهای مختلف داده استفاده میکند و نقش مهمی در توسعه مدلهای زبانی مدرن دارد.
آیا ChatGPT همان Transformer است؟
خیر. Transformer یک معماری است، اما ChatGPT یک سامانه گفتوگویی است که از مدلهای زبانی مبتنی بر معماری Transformer استفاده میکند.
Attention در هوش مصنوعی چه کاری انجام میدهد؟
Attention به مدل کمک میکند هنگام پردازش یک بخش از داده، اهمیت بخشهای مرتبط دیگر را محاسبه کند و ارتباط میان آنها را بهتر در نظر بگیرد.
چرا Transformer مهم است؟
Transformer امکان آموزش کارآمدتر مدلهای بزرگ و یادگیری ارتباطهای پیچیده میان بخشهای مختلف داده را فراهم کرد و به یکی از پایههای مهم هوش مصنوعی مولد و مدلهای زبانی بزرگ تبدیل شد.
LLM چیست؟
LLM مخفف Large Language Model یا «مدل زبانی بزرگ» است؛ مدلی که با حجم زیادی از دادههای متنی آموزش داده میشود تا بتواند وظایف مختلف مرتبط با زبان، مانند تولید و تحلیل متن، را انجام دهد.
تحقیق و تدوین مهدی گمرکی
