مبانی مدلهای زبانی بزرگ (LLM)
قبل از سراغ رفتن به ایجنتها و پروتکلها، باید بدانیم زیر کاپوت یک مدل زبانی بزرگ چه میگذرد. این صفحه پایهی مفهومی تمام صفحات دیگر این مستندات است.
LLM دقیقاً چیست؟
یک مدل زبانی بزرگ (Large Language Model) شبکهی عصبیای است که روی حجم عظیمی از متن آموزش دیده تا یک کار ساده اما قدرتمند را انجام دهد: با دیدن یک دنباله از متن، محتملترین «توکن بعدی» را پیشبینی کند. با تکرار همین پیشبینی، توکن به توکن، جمله و پاراگراف ساخته میشود. نکتهی شگفتانگیز این است که از دل همین کار بهظاهر ساده، تواناییهایی مثل استدلال، خلاصهسازی، ترجمه و حتی نوشتن کد بیرون میآید.
توکنسازی (Tokenization)
مدلهای زبانی مستقیماً با حروف یا کلمات کار نمیکنند؛ متن ابتدا به واحدهای کوچکتری به نام توکن شکسته میشود (میتواند یک کلمه، بخشی از یک کلمه، یا حتی یک نویسنده باشد). برای مثال «سلام دنیا» ممکن است به دو یا سه توکن تقسیم شود. هزینهی استفاده از اکثر APIهای مدلهای زبانی هم بر اساس تعداد همین توکنها محاسبه میشود، نه تعداد کاراکتر یا کلمه.
معماری ترنسفورمر
تقریباً تمام LLMهای امروزی بر پایهی معماری Transformer ساخته شدهاند که در سال ۲۰۱۷ معرفی شد. مکانیزم کلیدی آن Self-Attention است: برای پیشبینی هر توکن، مدل به تمام توکنهای قبلی نگاه میکند و «وزن» میدهد که کدامیک برای این پیشبینی مهمتر هستند. همین مکانیزم به مدل اجازه میدهد وابستگیهای دوردست در متن را درک کند (مثلاً فاعل یک جمله را در سه خط قبلتر به خاطر بسپارد).
مراحل آموزش
- Pretraining — مدل روی حجم عظیمی از متن عمومی (وب، کتاب، کد) آموزش میبیند تا زبان و دانش عمومی را یاد بگیرد.
- Fine-tuning — مدل روی مجموعهدادههای کوچکتر و هدفمندتر (مثلاً مکالمه یا دستورالعمل) تنظیم دقیق میشود.
- RLHF / Alignment — با بازخورد انسانی، مدل یاد میگیرد پاسخهای مفیدتر، ایمنتر و همسوتر با نیت کاربر بدهد.
پنجره کانتکست (Context Window)
مدل در هر فراخوانی فقط به مقدار محدودی متن (اندازهگیریشده بر حسب توکن) بهعنوان «حافظهی کاری» دسترسی دارد؛ به این محدوده پنجره کانتکست میگویند. هر چیزی خارج از این پنجره، برای مدل در آن فراخوانی خاص عملاً وجود ندارد — همین محدودیت، دلیل اصلی نیاز به مفاهیمی مثل RAG و حافظه ایجنت است.
پرامپتنویسی پایه
اکثر APIهای مدلهای زبانی امروزی، مکالمه را بهشکل فهرستی از پیامها با نقش مشخص دریافت میکنند:
[
{ "role": "system", "content": "شما یک دستیار فروشگاه آنلاین هستید." },
{ "role": "user", "content": "قیمت هدفون بیسیم مدل X چقدر است؟" }
]
نقش system رفتار کلی مدل را تعیین میکند، user پیام کاربر است، و assistant پاسخ مدل.
پارامترهای نمونهگیری خروجی (Decoding)
مدل در هر قدم یک توزیع احتمال روی کل واژگان ممکن برای توکن بعدی تولید میکند، نه یک پاسخ قطعی. اینکه کدام توکن از آن توزیع انتخاب شود، به چند پارامتر قابلتنظیم بستگی دارد:
- Temperature — میزان «ریسکپذیری» در انتخاب. مقدار نزدیک به صفر یعنی همیشه محتملترین توکن انتخاب شود (خروجی قابلپیشبینیتر و تکراریتر)؛ مقدار بالاتر (مثلاً ۱ به بالا) یعنی توکنهای کممحتملتر هم شانس انتخاب دارند (خروجی متنوعتر اما ریسک خطای بیشتر).
- Top-p (Nucleus Sampling) — بهجای در نظر گرفتن کل واژگان، مدل فقط از کوچکترین مجموعهی توکنهایی انتخاب میکند که مجموع احتمالشان به p میرسد (مثلاً ۰.۹). با Temperature ترکیب میشود تا هم تنوع کنترل شود، هم توکنهای بیربط با احتمال خیلی پایین کاملاً حذف شوند.
- Top-k — مشابه Top-p، اما بهجای آستانهی احتمال، تعداد ثابتی از محتملترین توکنها (مثلاً ۴۰ تای برتر) در نظر گرفته میشود.
برای کاربردهایی که نیاز به دقت و ثبات دارند (مثل استخراج اطلاعات ساختاریافته یا فراخوانی ابزار در یک ایجنت)، معمولاً Temperature پایینتر انتخاب میشود؛ برای تولید محتوای خلاقانه، مقدار بالاتر.
محدودیتها
- Hallucination — مدل ممکن است با اطمینان کامل، اطلاعات نادرست تولید کند.
- محدودیت دانش (Knowledge Cutoff) — مدل فقط چیزهایی را «میداند» که تا زمان آموزش دیده است.
- محدودیت پنجره کانتکست — نمیتواند حجم نامحدودی از متن را همزمان پردازش کند.
- عدم قطعیت (Non-determinism) — پاسخ به یک ورودی یکسان ممکن است هر بار کمی متفاوت باشد.
چرا این مبانی برای تجارت عاملمحور مهم است؟
وقتی یک ایجنت هوش مصنوعی قرار است از طرف کاربر خرید کند، همین محدودیتها مستقیماً روی طراحی سیستم شما اثر میگذارند: محدودیت دانش یعنی ایجنت باید بتواند اطلاعات لحظهای (مثل موجودی) را از طریق ابزار بگیرد — دقیقاً کاری که MCP ممکن میکند. محدودیت پنجره کانتکست یعنی نمیتوان کل کاتالوگ محصولات را در پرامپت جا داد، پس به بازیابی هوشمند نیاز است — موضوع صفحهی RAG.
سوالات متداول
آیا LLM واقعاً «فکر» میکند؟
از نظر فنی، مدل در حال پیشبینی آماری توکن بعدی است، نه استدلال به سبک انسانی. اما در عمل، این پیشبینی آماری در مقیاس بزرگ رفتاری شبیه استدلال از خود نشان میدهد.
تفاوت پارامتر مدل با توکن چیست؟
پارامترها وزنهای داخلی شبکه عصبیاند که در آموزش تنظیم میشوند (ثابت پس از آموزش)؛ توکنها واحدهای متنی هستند که در زمان استفاده از مدل عبور میکنند.