هوش مصنوعی / مدل‌های زبانی

مدل زبانی بزرگ (LLM) چیست و چطور کار می‌کند؟

مدل زبانی بزرگ (LLM) چطور متن می‌سازد؛ توکن، پارامتر، پنجره‌ی context، مراحل آموزش، علت اطلاعات غلط و سخت افزار لازم برای اجرا، به زبان مهندس زیرساخت.

نوشته‌ی تیم پیکوگاید آخرین بازبینی فنی: ۴ دقیقه مطالعه
در این صفحه
  1. توکن: واحدی که مدل با آن کار می‌کند
  2. مدل چطور جواب می‌سازد
  3. معماری Transformer در یک پاراگراف
  4. پارامترها
  5. پنجره‌ی context
  6. مراحل ساخت یک مدل
  7. چرا مدل گاهی اطلاعات غلط می‌سازد
  8. مدل متن باز یا سرویس ابری؟
  9. چه سخت افزاری لازم است؟

مدل زبانی بزرگ (Large Language Model) یک شبکه‌ی عصبی است که یاد گرفته کلمه‌ی بعدی یک متن را پیش بینی کند. همین کار ساده، وقتی روی حجم عظیمی از متن و با میلیاردها پارامتر انجام شود، به توانایی‌هایی مثل جواب دادن به سؤال، نوشتن کد، خلاصه کردن و ترجمه می‌رسد. ChatGPT، Claude، Gemini، DeepSeek و Llama همه بر همین پایه ساخته شده‌اند.

توکن: واحدی که مدل با آن کار می‌کند

مدل متن را حرف به حرف یا کلمه به کلمه نمی‌خواند؛ آن را به توکن تقسیم می‌کند. توکن ممکن است یک کلمه، بخشی از یک کلمه یا یک علامت باشد. کلمه‌های رایج انگلیسی معمولاً یک توکن‌اند، ولی متن فارسی در بیشتر مدل‌ها به توکن‌های بیشتری تقسیم می‌شود. به همین دلیل پردازش یک متن فارسی معمولاً از متن انگلیسی هم‌طول گران‌تر و کندتر است.

قیمت گذاری API، سرعت پاسخ و محدودیت حجم ورودی همه بر حسب توکن بیان می‌شوند.

مدل چطور جواب می‌سازد

مدل در هر قدم، با دیدن همه‌ی توکن‌های قبلی، برای هر توکن ممکن یک احتمال حساب می‌کند. یکی از توکن‌های محتمل انتخاب و به متن اضافه می‌شود و همین کار برای توکن بعدی تکرار می‌شود. جوابی که می‌بینید، توکن به توکن ساخته شده است؛ به همین دلیل پاسخ‌ها به صورت جاری روی صفحه ظاهر می‌شوند.

پارامتری به نام temperature تعیین می‌کند مدل چقدر از محتمل‌ترین انتخاب فاصله بگیرد. temperature پایین جواب‌های قابل پیش بینی‌تر می‌دهد (مناسب کد و کارهای فنی) و temperature بالا جواب‌های متنوع‌تر.

معماری Transformer در یک پاراگراف

تقریباً همه‌ی مدل‌های زبانی امروزی بر معماری Transformer بنا شده‌اند که سال ۲۰۱۷ معرفی شد. قلب آن مکانیزم attention است: مدل برای فهم هر توکن، به همه‌ی توکن‌های دیگر متن نگاه می‌کند و تصمیم می‌گیرد کدام‌ها مهم‌ترند. مثلاً در جمله‌ی «سوییچ را ری استارت کردم چون گرم شده بود»، attention کمک می‌کند مدل بفهمد «گرم شده بود» به سوییچ برمی‌گردد.

پارامترها

پارامترها وزن‌های عددی شبکه‌ی عصبی هستند که در آموزش تنظیم می‌شوند. وقتی می‌گویند مدلی «۷۰ میلیارد پارامتر» دارد، یعنی ۷۰ میلیارد عدد که دانش مدل در آن‌ها فشرده شده است. مدل بزرگ‌تر معمولاً تواناتر است، ولی حافظه و توان پردازشی بیشتری هم می‌خواهد.

پنجره‌ی context

context window حداکثر تعداد توکنی است که مدل در یک لحظه می‌بیند: پیام‌های گفتگو، اسنادی که به آن داده‌اید و جوابی که می‌نویسد. هر چیزی بیرون از این پنجره برای مدل وجود ندارد. مدل‌های امروزی context صدها هزار توکنی دارند، ولی هرچه context پرتر باشد، پاسخ کندتر و گران‌تر می‌شود و حافظه‌ی بیشتری روی GPU مصرف می‌کند.

مراحل ساخت یک مدل

مرحله چه اتفاقی می‌افتد نتیجه
پیش آموزش (pre-training) پیش بینی توکن بعدی روی حجم عظیمی از متن اینترنت، کتاب و کد مدلی که زبان و دانش عمومی را بلد است، ولی دستیار نیست
تنظیم با دستورالعمل (instruction tuning) آموزش روی نمونه‌های سؤال و جواب با کیفیت مدلی که دستور را دنبال می‌کند
یادگیری از بازخورد (RLHF و روش‌های مشابه) امتیازدهی به جواب‌ها و تقویت جواب‌های بهتر دستیاری مفیدتر، دقیق‌تر و امن‌تر

پیش آموزش پرهزینه‌ترین مرحله است و روی هزاران GPU به مدت هفته‌ها یا ماه‌ها انجام می‌شود. سازمان‌ها معمولاً مدل آماده را می‌گیرند و در نهایت با fine-tuning یا اتصال به اسناد خودشان (RAG) آن را تطبیق می‌دهند.

چرا مدل گاهی اطلاعات غلط می‌سازد

مدل زبانی پایگاه داده نیست؛ متنی تولید می‌کند که محتمل به نظر می‌رسد. اگر درباره‌ی موضوعی داده‌ی کافی ندیده باشد، جوابی می‌سازد که شکل درستی دارد ولی ممکن است غلط باشد: یک دستور CLI که وجود ندارد، یک شماره‌ی مدل ساختگی یا یک پارامتر اشتباه. به این پدیده hallucination می‌گویند.

مدل متن باز یا سرویس ابری؟

سرویس ابری (API) مدل با وزن باز روی سرور خودتان
نمونه ChatGPT، Claude، Gemini Llama، Qwen، Mistral، DeepSeek
توانایی معمولاً قوی‌ترین مدل‌ها به قوی‌ترین‌ها نزدیک شده‌اند، با فاصله
داده از سازمان خارج می‌شود داخل سازمان می‌ماند
هزینه بر اساس مصرف خرید سخت افزار و نگه داری
نگه داری با ارائه دهنده با تیم شما

برای اجرای یک مدل با وزن باز روی سرور خودتان، آموزش Ollama را ببینید.

چه سخت افزاری لازم است؟

برای اجرای یک مدل، همه‌ی پارامترهایش باید در حافظه‌ی GPU جا شود. یک قاعده‌ی سرانگشتی:

دقت حافظه برای هر میلیارد پارامتر مدل ۷۰ میلیاردی
FP16 / BF16 حدود ۲ گیگابایت حدود ۱۴۰ گیگابایت
INT8 حدود ۱ گیگابایت حدود ۷۰ گیگابایت
INT4 حدود ۰٫۵ گیگابایت حدود ۳۵ گیگابایت

این فقط وزن‌های مدل است. context طولانی و کاربران هم‌زمان حافظه‌ی بیشتری برای KV cache می‌خواهند. کاهش دقت (quantization) حافظه را کم می‌کند، به قیمت افت اندکی در کیفیت. مشخصات و مقایسه‌ی GPUهای دیتاسنتر را در مشخصات پردازنده‌های گرافیکی ببینید. حساب کامل VRAM و KV cache و انتخاب GPU در سخت افزار لازم برای اجرای LLM آمده است.

منابع

  1. Attention Is All You Need (Vaswani et al., 2017) arxiv.org
  2. Large language model (Wikipedia) en.wikipedia.org