مدل زبانی بزرگ (LLM) چیست و چگونه کار میکند؟ به زبان ساده
مدل زبانی بزرگ (LLM) چیست؟ از توکن و ترنسفورمر تا آموزش، پنجره زمینه، دما و توهم؛ هر آنچه برای فهم دقیق ChatGPT و Claude و Gemini لازم دارید.

فهرست مطالب
مدل زبانی بزرگ (Large Language Model یا LLM) موتور پشت ChatGPT، Claude، Gemini و دهها ابزار هوش مصنوعی دیگر است. در ظاهر با شما حرف میزند، کد مینویسد و متن ترجمه میکند؛ اما در عمق، کارش یک چیز ساده است: پیشبینی تکه بعدی متن. در این راهنما قدمبهقدم میبینیم این پیشبینی ساده چطور به چنین تواناییهایی میرسد و کجا نباید به آن اعتماد کرد.
مدل زبانی بزرگ چیست؟
مدل زبانی بزرگ یک شبکه عصبی مصنوعی با میلیاردها پارامتر است که روی حجم عظیمی از متن آموزش دیده تا یاد بگیرد با دیدن یک متن، ادامه محتمل آن را حدس بزند. «بزرگ» هم به تعداد پارامترها اشاره دارد و هم به مقدار داده آموزشی.
پارامترها اعدادی هستند که در طول آموزش تنظیم میشوند؛ چیزی شبیه پیچهای ریز یک دستگاه بسیار پیچیده. مدل هیچ متنی را کلمهبهکلمه در خود «ذخیره» نمیکند، بلکه الگوهای زبان، دانش عمومی و حتی الگوهای استدلال را در همین اعداد فشرده میکند.
وقتی از ChatGPT سؤال میپرسید، مدل در هر مرحله فقط یک توکن تولید میکند، آن را به انتهای متن اضافه میکند و دوباره پیشبینی میکند. پاسخ چندپاراگرافی، حاصل صدها بار تکرار همین حلقه است.
توکن: واحد فکر کردن مدل
مدلها مستقیم با حروف یا کلمهها کار نمیکنند؛ متن ابتدا به توکن (Token) شکسته میشود. توکن میتواند یک کلمه کامل، بخشی از کلمه یا حتی یک علامت نگارشی باشد. این کار را توکنایزر (Tokenizer) انجام میدهد.
با کتابخانه tiktoken میتوانید ببینید یک جمله چند توکن است:
# pip install tiktoken
import tiktoken
enc = tiktoken.get_encoding("o200k_base")
for text in ["Large language models predict the next token.",
"مدلهای زبانی بزرگ توکن بعدی را پیشبینی میکنند."]:
tokens = enc.encode(text)
print(len(tokens), "tokens:", text)
این موضوع برای ما فارسیزبانها اهمیت عملی دارد. توکنایزرها بیشتر روی متن انگلیسی بهینه شدهاند و متن فارسی معمولاً به توکنهای بیشتری تقسیم میشود. نتیجه؟ هزینه API بیشتر و پر شدن سریعتر پنجره زمینه.
ترنسفورمر و سازوکار توجه
تقریباً همه مدلهای زبانی امروزی بر پایه معماری ترنسفورمر (Transformer) ساخته شدهاند که پژوهشگران گوگل در سال ۲۰۱۷ در مقاله معروف «Attention Is All You Need» معرفی کرد. مسیر کلی داده در ترنسفورمر این است:
- جاسازی (Embedding): هر توکن به یک بردار عددی چندصدبعدی تبدیل میشود که معنای آن را نمایندگی میکند.
- لایههای توجه (Attention): در هر لایه، هر توکن به همه توکنهای قبلی «نگاه» میکند و تصمیم میگیرد کدامها برای فهم خودش مهمترند.
- لایههای پیشخور (Feed-forward): اطلاعات جمعشده در هر توکن پردازش و غنیتر میشود.
- خروجی: در پایان، مدل برای همه توکنهای واژگانش احتمال میسازد و یکی انتخاب میشود.
جمله «علی کتاب را به مریم داد چون او آن را خواسته بود» را در نظر بگیرید. سازوکار توجه همان چیزی است که به مدل کمک میکند بفهمد «او» به مریم برمیگردد، نه علی. مدلهای بزرگ دهها لایه از این جنس دارند و هر لایه روابط انتزاعیتری را کشف میکند.
یک مدل زبانی بزرگ چطور آموزش میبیند؟
ساخت یک LLM کاربردی معمولاً سه مرحله اصلی دارد.
۱. پیشآموزش (Pre-training)
مدل روی حجم بسیار بزرگی از متن اینترنت، کتابها، کد و منابع دیگر آموزش میبیند. تنها تکلیفش پیشبینی توکن بعدی است. این مرحله گرانترین بخش کار است و به هزاران GPU و هفتهها یا ماهها زمان نیاز دارد. خروجی آن «مدل پایه» است که زبان را میفهمد اما لزوماً دستورپذیر نیست.
۲. تنظیم دقیق دستوری (Instruction Tuning)
مدل پایه اگر بپرسید «پایتخت فرانسه کجاست؟» ممکن است بهجای جواب، چند سؤال مشابه دیگر بنویسد! در این مرحله مدل روی نمونههای «دستور و پاسخ مطلوب» آموزش میبیند تا یاد بگیرد مثل یک دستیار رفتار کند.
۳. همراستاسازی با بازخورد (RLHF و روشهای مشابه)
در یادگیری تقویتی با بازخورد انسانی (RLHF)، انسانها پاسخهای مختلف مدل را رتبهبندی میکنند و مدل یاد میگیرد پاسخهای مفیدتر، صادقتر و بیخطرتر تولید کند. OpenAI در سال ۲۰۲۲ در مقاله InstructGPT نشان داد این روش چقدر مدل را دستورپذیرتر و مفیدتر میکند و امروز انواع مختلفی از آن در آزمایشگاههای بزرگ به کار میرود.
مفاهیمی که هر توسعهدهنده باید بشناسد
پنجره زمینه (Context Window)
حداکثر تعداد توکنی که مدل در یک درخواست میتواند ببیند؛ شامل پرامپت، تاریخچه گفتوگو، اسناد ضمیمه و خود پاسخ. مدلهای پیشرو امروز پنجره زمینهای در حد یک میلیون توکن دارند، اما بزرگ بودن پنجره به این معنا نیست که مدل همه جزئیات آن را با دقت یکسان به خاطر میسپارد.
دما (Temperature)
مدل برای توکن بعدی یک توزیع احتمال میسازد. دمای پایین انتخاب را به گزینههای محتملتر محدود میکند و خروجی قابل پیشبینیتر میشود؛ دمای بالا تنوع و خلاقیت را بیشتر میکند. برای استخراج داده یا کد، دمای پایینتر معمولاً بهتر است.
مدلهای استدلالی (Reasoning Models)
نسل جدید مدلها پیش از پاسخ نهایی، یک مسیر فکری میانی تولید میکنند. این «فکر کردن» در ریاضی، کدنویسی و مسائل چندمرحلهای دقت را بهطور محسوس بالا میبرد. بسیاری از APIها امروز اجازه میدهند میزان این تلاش را تنظیم کنید.
چندوجهی بودن (Multimodality)
مدلهای امروزی علاوه بر متن، تصویر و گاهی صدا و ویدیو را هم ورودی میگیرند. از نظر فنی، تصویر هم به توکنهایی تبدیل میشود که کنار توکنهای متن پردازش میشوند.
محدودیتها: کجا نباید به LLM اعتماد کرد؟
توهم (Hallucination): مدل برای تولید متن محتمل آموزش دیده، نه گفتن حقیقت. وقتی چیزی را نمیداند، ممکن است یک مرجع، عدد یا تابع کتابخانهای کاملاً ساختگی اما باورپذیر بسازد.
مرز دانش (Knowledge Cutoff): دانش مدل به دادههای آموزشیاش محدود است و از رویدادهای بعد از آن خبر ندارد، مگر اینکه به جستوجو یا اسناد بیرونی دسترسی داشته باشد.
حساب و منطق دقیق: مدلهای استدلالی بهتر شدهاند، اما برای محاسبه دقیق هنوز بهتر است مدل را به ابزار (مثلاً اجرای کد) وصل کنید.
حریم خصوصی: هر چه در پرامپت میفرستید به سرور ارائهدهنده میرود. برای داده حساس، شرایط استفاده را بخوانید یا از مدلهای لوکال با Ollama استفاده کنید.
مدلهای زبانی بزرگ مشهور
بازار امروز دو دسته اصلی دارد:
| دسته | نمونهها | مزیت اصلی |
|---|---|---|
| مدلهای تجاری (API) | خانواده GPT از OpenAI، Claude از Anthropic، Gemini از گوگل | بالاترین کیفیت، بدون نیاز به سختافزار |
| مدلهای با وزن باز (Open-weight) | Qwen از علیبابا، Gemma از گوگل، Llama از متا، gpt-oss از OpenAI | اجرا روی سیستم خودتان، کنترل کامل داده |
این بازار هر ماه تغییر میکند؛ برای نمونه خبر انتشار Claude Opus 5.5 و GPT-6 Sol و Luna را در همین ماه پوشش دادهایم.
از چتبات تا ایجنت: قدم بعدی
خود مدل زبانی فقط متن میگیرد و متن پس میدهد. قدرت واقعی وقتی آزاد میشود که آن را به دنیای بیرون وصل کنید:
- با RAG مدل را به اسناد و دادههای خودتان وصل میکنید تا با اطلاعات بهروز و دقیق پاسخ بدهد. راهنمای عملیاش را در آموزش RAG با پایتون نوشتهایم.
- با ابزار و ایجنتها مدل میتواند API صدا بزند، فایل بخواند و کار انجام دهد. استاندارد رایج این کار را در پروتکل MCP به زبان ساده توضیح دادهایم.
فهمیدن اینکه مدل زبانی بزرگ در اصل یک پیشبینیکننده توکن است، مهمترین قدم برای استفاده درست از آن است. نه جادوست و نه «فقط یک تکمیلکننده خودکار»؛ ابزاری قدرتمند با محدودیتهای مشخص که اگر بشناسیدشان، بهتر از آن کار میکشید.



