۱۴۰۵ مهر ۶, دوشنبه
دلار آمریکا۲۴۳٬۴۱۵▲ ۳٫۵۸٪یورو۲۷۷٬۰۰۰▲ ۳٫۳۹٪درهم امارات۶۶٬۳۰۵▲ ۳٫۶۱٪سکه امامی۲۴۴٬۵۰۵٬۰۰۰▲ ۱٫۶۶٪طلای ۱۸ عیار (گرم)۲۴٬۳۱۹٬۰۰۰▲ ۱٫۷۵٪انس طلا۴٬۱۵۰ $▼ ۳٫۲۶٪تتر۲۴۴٬۴۵۶▲ ۳٫۲۴٪بیت‌کوین۸۲٬۶۵۳ $▼ ۲٫۴۱٪اتریوم۲٬۶۴۰ $▼ ۱٫۸۹٪سولانا۱۱۷٫۸۴ $▼ ۴٫۳۴٪اپل۳۴۱٫۰۷ $▲ ۱٫۵۳٪انویدیا۲۲۵٫۰۷ $▲ ۰٫۲۲٪مایکروسافت۵۱۶٫۱۷ $▲ ۳٫۶۶٪آلفابت (گوگل)۳۴۳٫۹۲ $▲ ۰٫۴۶٪تسلا۳۷۲٫۱۱ $▼ ۱٫۵۴٪شاخص نزدک۲۷٬۰۶۹ $▲ ۰٫۴۸٪
نرخ ارز

مدل زبانی بزرگ (LLM) چیست و چگونه کار می‌کند؟ به زبان ساده

مدل زبانی بزرگ (LLM) چیست؟ از توکن و ترنسفورمر تا آموزش، پنجره زمینه، دما و توهم؛ هر آنچه برای فهم دقیق ChatGPT و Claude و Gemini لازم دارید.

هوش مصنوعی۶ دقیقه مطالعه
مدل زبانی بزرگ (LLM) چیست و چگونه کار می‌کند؟ به زبان ساده
فهرست مطالب
  1. مدل زبانی بزرگ چیست؟
  2. توکن: واحد فکر کردن مدل
  3. ترنسفورمر و سازوکار توجه
  4. یک مدل زبانی بزرگ چطور آموزش می‌بیند؟
  5. مفاهیمی که هر توسعه‌دهنده باید بشناسد
  6. محدودیت‌ها: کجا نباید به LLM اعتماد کرد؟
  7. مدل‌های زبانی بزرگ مشهور
  8. از چت‌بات تا ایجنت: قدم بعدی

مدل زبانی بزرگ (Large Language Model یا LLM) موتور پشت ChatGPT، Claude، Gemini و ده‌ها ابزار هوش مصنوعی دیگر است. در ظاهر با شما حرف می‌زند، کد می‌نویسد و متن ترجمه می‌کند؛ اما در عمق، کارش یک چیز ساده است: پیش‌بینی تکه بعدی متن. در این راهنما قدم‌به‌قدم می‌بینیم این پیش‌بینی ساده چطور به چنین توانایی‌هایی می‌رسد و کجا نباید به آن اعتماد کرد.

مدل زبانی بزرگ چیست؟

مدل زبانی بزرگ یک شبکه عصبی مصنوعی با میلیاردها پارامتر است که روی حجم عظیمی از متن آموزش دیده تا یاد بگیرد با دیدن یک متن، ادامه محتمل آن را حدس بزند. «بزرگ» هم به تعداد پارامترها اشاره دارد و هم به مقدار داده آموزشی.

پارامترها اعدادی هستند که در طول آموزش تنظیم می‌شوند؛ چیزی شبیه پیچ‌های ریز یک دستگاه بسیار پیچیده. مدل هیچ متنی را کلمه‌به‌کلمه در خود «ذخیره» نمی‌کند، بلکه الگوهای زبان، دانش عمومی و حتی الگوهای استدلال را در همین اعداد فشرده می‌کند.

وقتی از ChatGPT سؤال می‌پرسید، مدل در هر مرحله فقط یک توکن تولید می‌کند، آن را به انتهای متن اضافه می‌کند و دوباره پیش‌بینی می‌کند. پاسخ چندپاراگرافی، حاصل صدها بار تکرار همین حلقه است.

توکن: واحد فکر کردن مدل

مدل‌ها مستقیم با حروف یا کلمه‌ها کار نمی‌کنند؛ متن ابتدا به توکن (Token) شکسته می‌شود. توکن می‌تواند یک کلمه کامل، بخشی از کلمه یا حتی یک علامت نگارشی باشد. این کار را توکنایزر (Tokenizer) انجام می‌دهد.

با کتابخانه tiktoken می‌توانید ببینید یک جمله چند توکن است:

# pip install tiktoken
import tiktoken

enc = tiktoken.get_encoding("o200k_base")

for text in ["Large language models predict the next token.",
             "مدل‌های زبانی بزرگ توکن بعدی را پیش‌بینی می‌کنند."]:
    tokens = enc.encode(text)
    print(len(tokens), "tokens:", text)

این موضوع برای ما فارسی‌زبان‌ها اهمیت عملی دارد. توکنایزرها بیشتر روی متن انگلیسی بهینه شده‌اند و متن فارسی معمولاً به توکن‌های بیشتری تقسیم می‌شود. نتیجه؟ هزینه API بیشتر و پر شدن سریع‌تر پنجره زمینه.

ترنسفورمر و سازوکار توجه

تقریباً همه مدل‌های زبانی امروزی بر پایه معماری ترنسفورمر (Transformer) ساخته شده‌اند که پژوهشگران گوگل در سال ۲۰۱۷ در مقاله معروف «Attention Is All You Need» معرفی کرد. مسیر کلی داده در ترنسفورمر این است:

  1. جاسازی (Embedding): هر توکن به یک بردار عددی چندصدبعدی تبدیل می‌شود که معنای آن را نمایندگی می‌کند.
  2. لایه‌های توجه (Attention): در هر لایه، هر توکن به همه توکن‌های قبلی «نگاه» می‌کند و تصمیم می‌گیرد کدام‌ها برای فهم خودش مهم‌ترند.
  3. لایه‌های پیش‌خور (Feed-forward): اطلاعات جمع‌شده در هر توکن پردازش و غنی‌تر می‌شود.
  4. خروجی: در پایان، مدل برای همه توکن‌های واژگانش احتمال می‌سازد و یکی انتخاب می‌شود.

جمله «علی کتاب را به مریم داد چون او آن را خواسته بود» را در نظر بگیرید. سازوکار توجه همان چیزی است که به مدل کمک می‌کند بفهمد «او» به مریم برمی‌گردد، نه علی. مدل‌های بزرگ ده‌ها لایه از این جنس دارند و هر لایه روابط انتزاعی‌تری را کشف می‌کند.

یک مدل زبانی بزرگ چطور آموزش می‌بیند؟

ساخت یک LLM کاربردی معمولاً سه مرحله اصلی دارد.

۱. پیش‌آموزش (Pre-training)

مدل روی حجم بسیار بزرگی از متن اینترنت، کتاب‌ها، کد و منابع دیگر آموزش می‌بیند. تنها تکلیفش پیش‌بینی توکن بعدی است. این مرحله گران‌ترین بخش کار است و به هزاران GPU و هفته‌ها یا ماه‌ها زمان نیاز دارد. خروجی آن «مدل پایه» است که زبان را می‌فهمد اما لزوماً دستورپذیر نیست.

۲. تنظیم دقیق دستوری (Instruction Tuning)

مدل پایه اگر بپرسید «پایتخت فرانسه کجاست؟» ممکن است به‌جای جواب، چند سؤال مشابه دیگر بنویسد! در این مرحله مدل روی نمونه‌های «دستور و پاسخ مطلوب» آموزش می‌بیند تا یاد بگیرد مثل یک دستیار رفتار کند.

۳. هم‌راستاسازی با بازخورد (RLHF و روش‌های مشابه)

در یادگیری تقویتی با بازخورد انسانی (RLHF)، انسان‌ها پاسخ‌های مختلف مدل را رتبه‌بندی می‌کنند و مدل یاد می‌گیرد پاسخ‌های مفیدتر، صادق‌تر و بی‌خطرتر تولید کند. OpenAI در سال ۲۰۲۲ در مقاله InstructGPT نشان داد این روش چقدر مدل را دستورپذیرتر و مفیدتر می‌کند و امروز انواع مختلفی از آن در آزمایشگاه‌های بزرگ به کار می‌رود.

مفاهیمی که هر توسعه‌دهنده باید بشناسد

پنجره زمینه (Context Window)

حداکثر تعداد توکنی که مدل در یک درخواست می‌تواند ببیند؛ شامل پرامپت، تاریخچه گفت‌وگو، اسناد ضمیمه و خود پاسخ. مدل‌های پیشرو امروز پنجره زمینه‌ای در حد یک میلیون توکن دارند، اما بزرگ بودن پنجره به این معنا نیست که مدل همه جزئیات آن را با دقت یکسان به خاطر می‌سپارد.

دما (Temperature)

مدل برای توکن بعدی یک توزیع احتمال می‌سازد. دمای پایین انتخاب را به گزینه‌های محتمل‌تر محدود می‌کند و خروجی قابل پیش‌بینی‌تر می‌شود؛ دمای بالا تنوع و خلاقیت را بیشتر می‌کند. برای استخراج داده یا کد، دمای پایین‌تر معمولاً بهتر است.

مدل‌های استدلالی (Reasoning Models)

نسل جدید مدل‌ها پیش از پاسخ نهایی، یک مسیر فکری میانی تولید می‌کنند. این «فکر کردن» در ریاضی، کدنویسی و مسائل چندمرحله‌ای دقت را به‌طور محسوس بالا می‌برد. بسیاری از APIها امروز اجازه می‌دهند میزان این تلاش را تنظیم کنید.

چندوجهی بودن (Multimodality)

مدل‌های امروزی علاوه بر متن، تصویر و گاهی صدا و ویدیو را هم ورودی می‌گیرند. از نظر فنی، تصویر هم به توکن‌هایی تبدیل می‌شود که کنار توکن‌های متن پردازش می‌شوند.

محدودیت‌ها: کجا نباید به LLM اعتماد کرد؟

توهم (Hallucination): مدل برای تولید متن محتمل آموزش دیده، نه گفتن حقیقت. وقتی چیزی را نمی‌داند، ممکن است یک مرجع، عدد یا تابع کتابخانه‌ای کاملاً ساختگی اما باورپذیر بسازد.

مرز دانش (Knowledge Cutoff): دانش مدل به داده‌های آموزشی‌اش محدود است و از رویدادهای بعد از آن خبر ندارد، مگر اینکه به جست‌وجو یا اسناد بیرونی دسترسی داشته باشد.

حساب و منطق دقیق: مدل‌های استدلالی بهتر شده‌اند، اما برای محاسبه دقیق هنوز بهتر است مدل را به ابزار (مثلاً اجرای کد) وصل کنید.

حریم خصوصی: هر چه در پرامپت می‌فرستید به سرور ارائه‌دهنده می‌رود. برای داده حساس، شرایط استفاده را بخوانید یا از مدل‌های لوکال با Ollama استفاده کنید.

مدل‌های زبانی بزرگ مشهور

بازار امروز دو دسته اصلی دارد:

دسته نمونه‌ها مزیت اصلی
مدل‌های تجاری (API) خانواده GPT از OpenAI، Claude از Anthropic، Gemini از گوگل بالاترین کیفیت، بدون نیاز به سخت‌افزار
مدل‌های با وزن باز (Open-weight) Qwen از علی‌بابا، Gemma از گوگل، Llama از متا، gpt-oss از OpenAI اجرا روی سیستم خودتان، کنترل کامل داده

این بازار هر ماه تغییر می‌کند؛ برای نمونه خبر انتشار Claude Opus 5.5 و GPT-6 Sol و Luna را در همین ماه پوشش داده‌ایم.

از چت‌بات تا ایجنت: قدم بعدی

خود مدل زبانی فقط متن می‌گیرد و متن پس می‌دهد. قدرت واقعی وقتی آزاد می‌شود که آن را به دنیای بیرون وصل کنید:

  • با RAG مدل را به اسناد و داده‌های خودتان وصل می‌کنید تا با اطلاعات به‌روز و دقیق پاسخ بدهد. راهنمای عملی‌اش را در آموزش RAG با پایتون نوشته‌ایم.
  • با ابزار و ایجنت‌ها مدل می‌تواند API صدا بزند، فایل بخواند و کار انجام دهد. استاندارد رایج این کار را در پروتکل MCP به زبان ساده توضیح داده‌ایم.

فهمیدن اینکه مدل زبانی بزرگ در اصل یک پیش‌بینی‌کننده توکن است، مهم‌ترین قدم برای استفاده درست از آن است. نه جادوست و نه «فقط یک تکمیل‌کننده خودکار»؛ ابزاری قدرتمند با محدودیت‌های مشخص که اگر بشناسیدشان، بهتر از آن کار می‌کشید.

پرسش‌های پرتکرار

مدل زبانی بزرگ (LLM) به زبان ساده چیست؟

برنامه‌ای مبتنی بر شبکه عصبی که با خواندن حجم عظیمی از متن یاد گرفته توکن بعدی را پیش‌بینی کند. همین پیش‌بینی پشت‌سرهم، پاسخ‌های روان ChatGPT، Claude و Gemini را می‌سازد.

چرا مدل‌های زبانی گاهی اطلاعات غلط می‌دهند؟

چون هدف آموزش‌شان تولید متن محتمل است، نه بازیابی حقیقت. وقتی دانش کافی ندارند، ممکن است پاسخی روان اما نادرست بسازند که به آن توهم (Hallucination) می‌گویند.

توکن چیست و چرا برای فارسی مهم است؟

توکن تکه‌ای از متن است که مدل با آن کار می‌کند. هزینه API و سقف پنجره زمینه بر حسب توکن حساب می‌شود و متن فارسی معمولاً توکن بیشتری از متن انگلیسی هم‌معنا مصرف می‌کند.

فرق مدل استدلالی با مدل زبانی معمولی چیست؟

مدل‌های استدلالی پیش از پاسخ نهایی، مسیر فکری میانی تولید می‌کنند. این کار در ریاضی، کدنویسی و مسائل چندمرحله‌ای دقت را بالا می‌برد، اما زمان و هزینه بیشتری دارد.

منابع

  1. Attention Is All You Need (Vaswani et al., 2017)
  2. Training language models to follow instructions with human feedback (Ouyang et al., 2022)
  3. tiktoken – OpenAI

خطایی در این مطلب دیدید؟ به تحریریه گزارش دهید؛ اصلاحیه‌ها طبق اصول تحریریه ثبت می‌شوند.

مطالب مرتبط