مدل زبانی بزرگ (LLM) چیست و چطور کار میکند؟
مدل زبانی بزرگ (LLM) چطور متن میسازد؛ توکن، پارامتر، پنجرهی context، مراحل آموزش، علت اطلاعات غلط و سخت افزار لازم برای اجرا، به زبان مهندس زیرساخت.
در این صفحه
مدل زبانی بزرگ (Large Language Model) یک شبکهی عصبی است که یاد گرفته کلمهی بعدی یک متن را پیش بینی کند. همین کار ساده، وقتی روی حجم عظیمی از متن و با میلیاردها پارامتر انجام شود، به تواناییهایی مثل جواب دادن به سؤال، نوشتن کد، خلاصه کردن و ترجمه میرسد. ChatGPT، Claude، Gemini، DeepSeek و Llama همه بر همین پایه ساخته شدهاند.
توکن: واحدی که مدل با آن کار میکند
مدل متن را حرف به حرف یا کلمه به کلمه نمیخواند؛ آن را به توکن تقسیم میکند. توکن ممکن است یک کلمه، بخشی از یک کلمه یا یک علامت باشد. کلمههای رایج انگلیسی معمولاً یک توکناند، ولی متن فارسی در بیشتر مدلها به توکنهای بیشتری تقسیم میشود. به همین دلیل پردازش یک متن فارسی معمولاً از متن انگلیسی همطول گرانتر و کندتر است.
قیمت گذاری API، سرعت پاسخ و محدودیت حجم ورودی همه بر حسب توکن بیان میشوند.
مدل چطور جواب میسازد
مدل در هر قدم، با دیدن همهی توکنهای قبلی، برای هر توکن ممکن یک احتمال حساب میکند. یکی از توکنهای محتمل انتخاب و به متن اضافه میشود و همین کار برای توکن بعدی تکرار میشود. جوابی که میبینید، توکن به توکن ساخته شده است؛ به همین دلیل پاسخها به صورت جاری روی صفحه ظاهر میشوند.
پارامتری به نام temperature تعیین میکند مدل چقدر از محتملترین انتخاب فاصله بگیرد. temperature پایین جوابهای قابل پیش بینیتر میدهد (مناسب کد و کارهای فنی) و temperature بالا جوابهای متنوعتر.
معماری Transformer در یک پاراگراف
تقریباً همهی مدلهای زبانی امروزی بر معماری Transformer بنا شدهاند که سال ۲۰۱۷ معرفی شد. قلب آن مکانیزم attention است: مدل برای فهم هر توکن، به همهی توکنهای دیگر متن نگاه میکند و تصمیم میگیرد کدامها مهمترند. مثلاً در جملهی «سوییچ را ری استارت کردم چون گرم شده بود»، attention کمک میکند مدل بفهمد «گرم شده بود» به سوییچ برمیگردد.
پارامترها
پارامترها وزنهای عددی شبکهی عصبی هستند که در آموزش تنظیم میشوند. وقتی میگویند مدلی «۷۰ میلیارد پارامتر» دارد، یعنی ۷۰ میلیارد عدد که دانش مدل در آنها فشرده شده است. مدل بزرگتر معمولاً تواناتر است، ولی حافظه و توان پردازشی بیشتری هم میخواهد.
پنجرهی context
context window حداکثر تعداد توکنی است که مدل در یک لحظه میبیند: پیامهای گفتگو، اسنادی که به آن دادهاید و جوابی که مینویسد. هر چیزی بیرون از این پنجره برای مدل وجود ندارد. مدلهای امروزی context صدها هزار توکنی دارند، ولی هرچه context پرتر باشد، پاسخ کندتر و گرانتر میشود و حافظهی بیشتری روی GPU مصرف میکند.
مراحل ساخت یک مدل
| مرحله | چه اتفاقی میافتد | نتیجه |
|---|---|---|
| پیش آموزش (pre-training) | پیش بینی توکن بعدی روی حجم عظیمی از متن اینترنت، کتاب و کد | مدلی که زبان و دانش عمومی را بلد است، ولی دستیار نیست |
| تنظیم با دستورالعمل (instruction tuning) | آموزش روی نمونههای سؤال و جواب با کیفیت | مدلی که دستور را دنبال میکند |
| یادگیری از بازخورد (RLHF و روشهای مشابه) | امتیازدهی به جوابها و تقویت جوابهای بهتر | دستیاری مفیدتر، دقیقتر و امنتر |
پیش آموزش پرهزینهترین مرحله است و روی هزاران GPU به مدت هفتهها یا ماهها انجام میشود. سازمانها معمولاً مدل آماده را میگیرند و در نهایت با fine-tuning یا اتصال به اسناد خودشان (RAG) آن را تطبیق میدهند.
چرا مدل گاهی اطلاعات غلط میسازد
مدل زبانی پایگاه داده نیست؛ متنی تولید میکند که محتمل به نظر میرسد. اگر دربارهی موضوعی دادهی کافی ندیده باشد، جوابی میسازد که شکل درستی دارد ولی ممکن است غلط باشد: یک دستور CLI که وجود ندارد، یک شمارهی مدل ساختگی یا یک پارامتر اشتباه. به این پدیده hallucination میگویند.
مدل متن باز یا سرویس ابری؟
| سرویس ابری (API) | مدل با وزن باز روی سرور خودتان | |
|---|---|---|
| نمونه | ChatGPT، Claude، Gemini | Llama، Qwen، Mistral، DeepSeek |
| توانایی | معمولاً قویترین مدلها | به قویترینها نزدیک شدهاند، با فاصله |
| داده | از سازمان خارج میشود | داخل سازمان میماند |
| هزینه | بر اساس مصرف | خرید سخت افزار و نگه داری |
| نگه داری | با ارائه دهنده | با تیم شما |
برای اجرای یک مدل با وزن باز روی سرور خودتان، آموزش Ollama را ببینید.
چه سخت افزاری لازم است؟
برای اجرای یک مدل، همهی پارامترهایش باید در حافظهی GPU جا شود. یک قاعدهی سرانگشتی:
| دقت | حافظه برای هر میلیارد پارامتر | مدل ۷۰ میلیاردی |
|---|---|---|
| FP16 / BF16 | حدود ۲ گیگابایت | حدود ۱۴۰ گیگابایت |
| INT8 | حدود ۱ گیگابایت | حدود ۷۰ گیگابایت |
| INT4 | حدود ۰٫۵ گیگابایت | حدود ۳۵ گیگابایت |
این فقط وزنهای مدل است. context طولانی و کاربران همزمان حافظهی بیشتری برای KV cache میخواهند. کاهش دقت (quantization) حافظه را کم میکند، به قیمت افت اندکی در کیفیت. مشخصات و مقایسهی GPUهای دیتاسنتر را در مشخصات پردازندههای گرافیکی ببینید. حساب کامل VRAM و KV cache و انتخاب GPU در سخت افزار لازم برای اجرای LLM آمده است.
منابع
- Attention Is All You Need (Vaswani et al., 2017) arxiv.org
- Large language model (Wikipedia) en.wikipedia.org