رفتن به محتوای اصلی
دانیال سمیعیمدرسهٔ تصمیم / هوش مصنوعیسایت اصلی ↗
مسیر یادگیری شما۰ از ۱۲ فصل

فصل ۴ / ۲۵ دقیقه مطالعهٔ مرجع

مدل، استدلال و Effort؛ انتخاب به‌اندازهٔ مسئله

تفاوت مدل سریع و استدلالی، بودجهٔ تلاش، زمینه، ابزار و اشتراک؛ با یک آزمایش کنترل‌شده برای تصمیم‌های مدیریتی.

بعد از این فصل می‌توانید…

  • مدل و سطح تلاش را با نیاز کار تطبیق می‌دهید.
  • تنظیم واقعی را از دستور زبانی تشخیص می‌دهید.
  • کیفیت، زمان و هزینه را هم‌زمان می‌سنجید.
۰۱

چرا یک مدل برای همهٔ کارها کافی نیست؟

خانواده‌های مدل از نظر سرعت، کیفیت استدلال، پردازش تصویر، طول زمینه، ابزار قابل‌استفاده و هزینه تفاوت دارند. نامی که در اپلیکیشن می‌بینید ممکن است یک مدل مشخص یا یک حالت مسیریابی خودکار باشد. مدل‌های خانوادهٔ GPT در OpenAI، Claude در Anthropic، Grok در xAI و Gemini در Google را با محصولی که آن‌ها را عرضه می‌کند اشتباه نگیرید.

به‌جای حفظ‌کردن فهرست نام‌هایی که مرتب عوض می‌شود، سه سبد بسازید: کارهای سریع و کم‌ریسک، تحلیل‌های چندمرحله‌ای و کارهای وابسته به ابزار یا دادهٔ خاص. برای بازنویسی یک دعوت‌نامه، انتخاب سنگین‌ترین مدل معمولاً اولین نیاز نیست؛ برای بررسی مفروضات یک تصمیم پیچیده، مدل مناسب و زمان بررسی بیشتر می‌تواند مفید باشد. نتیجه را با آزمون خودتان بسنجید.

نوع کارانتخاب آغازین پیشنهادیمعیار پذیرش
بازنویسی و قالب‌بندیمدل سریع با دستور روشنحفظ معنا، لحن و نام‌ها
مقایسهٔ چند گزینه و محدودیتمدل استدلالیِ در دسترسپوشش قیود و آزمون تناقض
اطلاعات تازهمدل همراه ابزار جست‌وجوی فعالمنبع اولیه و تاریخ معتبر
محاسبات جدولیابزار محاسبه همراه مدلتطبیق فرمول و عدد با نمونهٔ مرجع
سند بسیار طولانیمدیریت زمینه و بازیابی مناسبپوشش بخش‌ها و ارجاع دقیق
۰۲

نام‌های واقعی مدل‌ها؛ نمونهٔ مستند در ۲۰ سپتامبر ۲۰۲۶

برای خواندن فهرست مدل‌ها، نام خانواده، نسخه و شناسهٔ فنی را جدا ببینید. جدول زیر نمونه‌هایی است که در بازبینی ۲۰ سپتامبر ۲۰۲۶ در فهرست رسمی API سازندگان دیده شدند؛ فهرست کامل بازار یا تضمین دسترسی حساب شما نیست. وجود یک مدل در API به معنای نمایش همان نام در اپلیکیشن ChatGPT، Claude، Grok یا Gemini نیست. پلن، منطقه، نقش و سیاست سازمان بر دسترسی محصول اثر دارند.

ستون تمرین، پیشنهاد آموزشی این دوره برای مقایسه است و رتبه‌بندی مستقل مدل‌ها محسوب نمی‌شود. در خانوادهٔ Claude، Opus، Sonnet و Haiku نام رده‌های متفاوت‌اند؛ در Gemini، Pro و Flash نیز نام پلن اشتراک نیستند. پسوند preview در شناسهٔ Gemini 3.1 Pro را حفظ کنید تا نمونهٔ پیش‌نمایش را با نسخهٔ پایدار اشتباه نگیرید. پیش از خرید یا اتصال، لینک فهرست رسمی انتهای درس را دوباره باز کنید.

سازنده و نمونهٔ مدلشناسهٔ درج‌شده در APIتمرین پیشنهادی برای مقایسه
OpenAI؛ GPT-6 Astragpt-6-astraبررسی چندمرحله‌ای گزینه‌ها و قیود یک تصمیم
OpenAI؛ GPT-5.6 Sol / Terra / Lunagpt-5.6-sol / gpt-5.6-terra / gpt-5.6-lunaمقایسهٔ کیفیت، زمان و هزینه روی گزارش تکراری
Anthropic؛ Claude Opus 5 / Sonnet 5claude-opus-5 / claude-sonnet-5تحلیل سند و نقد پیشنهاد با ورودی یکسان
Anthropic؛ Claude Haiku 4.5claude-haiku-4-5-20251001کار محدود مانند طبقه‌بندی یا خلاصهٔ کوتاه
xAI؛ Grok 4.6grok-4.6پاسخ تحلیلی؛ جست‌وجوی وب فقط با ابزار فعال
Google؛ Gemini 3.1 Pro — Previewgemini-3.1-pro-previewمسئلهٔ چندقیدی با کنترل فرض و پاسخ مرجع
Google؛ Gemini 3.8 Flashgemini-3.8-flashمقایسهٔ سرعت و کیفیت در کار پرتکرار

مکث و تمرین

فهرست مدل‌های حساب خود را باز کنید و فقط نام‌هایی را که واقعاً می‌بینید ثبت کنید. یکی را با جدول تطبیق دهید. اگر نام متفاوت یا حالت Auto می‌بینید، همان را بنویسید و مدل پشت آن را حدس نزنید. برای تمرین کلاس نیازی به خرید API نیست.

۰۳

Effort چیست و چگونه تنظیم می‌شود؟

Effort یا سطح تلاش در مدل‌های پشتیبانی‌شده، تنظیمی برای میزان کار محاسباتی یا استدلالی مدل است. دامنه و نام گزینه‌ها به مدل و محصول وابسته است؛ همهٔ مدل‌ها گزینه‌های یکسان ندارند. افزایش آن می‌تواند زمان و هزینه را تغییر دهد و برای بعضی مسائل سودمند باشد، اما صحت را تضمین نمی‌کند.

اگر رابط شما کنترل تلاش یا تفکر دارد، همان کنترل را انتخاب و ثبت کنید. در API، توسعه‌دهنده باید پارامتر مستند و پشتیبانی‌شدهٔ همان مدل را تنظیم کند. نوشتن «effort را روی بالاترین مقدار بگذار» در متن، شاهد تغییر تنظیم نیست. درخواست «پاسخ را با دقت بررسی کن» می‌تواند راهنمای کار باشد، ولی با تغییر واقعی پارامتر تفاوت دارد.

برای میز تصمیم: تنظیم واقعی را از رابط یا پیکربندی معتبر می‌فهمیم؛ ادعای مدل دربارهٔ تنظیم خودش کافی نیست.

۰۴

گزینه‌های واقعی Effort؛ جدول را مدل‌به‌مدل بخوانید

low، medium و high به‌ترتیب برچسب تلاش کم، متوسط و زیاد در همان سامانه‌اند؛ xhigh و max، در مدل‌های پشتیبانی‌شده، سطوح بالاترند. none و minimal نیز فقط وقتی معتبرند که مستند همان مدل آن‌ها را بپذیرد. این واژه‌ها واحد مشترک اندازه‌گیری نیستند: high در دو سازنده یا حتی دو نسخه الزاماً زمان، توکن، کیفیت یا هزینهٔ برابر ندارد.

نمونه‌های زیر از مستندات رسمی API در ۲۰ سپتامبر ۲۰۲۶ گرفته شده‌اند. کاربر وب یا گوشی فقط از کنترل واقعاً موجود در حساب خود استفاده کند؛ نام گزینهٔ رابط ممکن است با پارامتر فنی متفاوت باشد. برای یک کار ساده می‌توانید سطح پایین‌ترِ پشتیبانی‌شده را آزمایش کنید و برای مسئلهٔ چندقیدی با شاهد کیفیت بالاتر بروید. گزینهٔ ناشناخته را به مدل تحمیل نکنید و پذیرش آن را از متن پاسخ استنتاج نکنید.

  • نام مدل، سطح انتخاب‌شده و ابزار فعال را در برگهٔ آزمایش ثبت کنید.
  • سقف خروجی مانند max_tokens یا max_output_tokens با effort یکی نیست؛ سقف کم ممکن است پاسخ را قطع کند.
  • none به معنای نبود تمام توان تحلیل یا تضمین پاسخ آنی نیست؛ معنای آن را در مستند همان مدل بخوانید.
  • اگر یک سرویس گزینهٔ دیگری مانند ultra نشان داد، آن را فقط برای همان سرویس و مدل مستند کنید؛ جدول جهانی و یکسانی وجود ندارد.
مدل و تنظیم مستندنمونهٔ مقادیر پشتیبانی‌شدهمرز مهم
GPT-6 Astra؛ reasoning.effortlow / medium / high / xhigh / maxnone در مستند این مدل پشتیبانی نمی‌شود.
GPT-5.6 Sol؛ reasoning.effortnone / low / medium / high / xhigh / maxاین فهرست را به همهٔ مدل‌های GPT تعمیم ندهید.
Claude Opus 5 و Sonnet 5؛ output_config.effortlow / medium / high / xhigh / maxHaiku 4.5 همین پارامتر effort را پشتیبانی نمی‌کند؛ adaptive نام حالت thinking است، نه مقدار effort.
Grok 4.6؛ reasoning_effortlow / medium / high / xhighطبق مستند، reasoning غیرفعال نمی‌شود؛ none گزینهٔ این مثال نیست.
Gemini 3.8 Flash و 3.1 Pro Preview؛ thinking_level در Interactions APIlow / medium / highنام پارامتر و رابط API را با نسخهٔ مورد استفاده تطبیق دهید.
Gemini 3.6 Flash؛ thinking_level در Interactions APIminimal / low / medium / highminimal در این مثال مستند است؛ آن را برای 3.8 Flash فرض نکنید.

برای میز تصمیم: مقایسهٔ درست این است: آیا همین کار، با همین داده و همین مدل، در سطح متفاوت خروجی بهتری می‌دهد؟ برابری نام گزینه‌ها، برابری توان مدل‌ها را ثابت نمی‌کند.

۰۵

استدلال بیشتر با جواب بلندتر یکی نیست

مدل ممکن است پاسخ کوتاه و دقیقی بدهد، درحالی‌که کار محاسباتی بیشتری انجام داده است؛ یا متن بسیار بلندی تولید کند که مسئله را حل نکرده باشد. طول پاسخ، زمان انتظار و نمایش عبارت «در حال فکرکردن» به‌تنهایی معیار صحت نیست. از مدل خروجی قابل‌بررسی بخواهید: فرض‌ها، محاسبهٔ خلاصه، شواهد و موارد نامطمئن.

برای ارزیابی لازم نیست جریان خصوصی و ریزِ تفکر مدل را درخواست کنید. توضیح کوتاه منطق تصمیم، فرمول استفاده‌شده و آزمون سازگاری برای بازبینی مفیدتر است. مثلاً در مقایسهٔ تأمین‌کننده، جدول امتیاز و حساسیت وزن‌ها را بخواهید؛ این خروجی را می‌توان مستقل محاسبه کرد و به هیئت‌مدیره نشان داد.

درخواست آمادهٔ تمرین
پاسخ نهایی را کوتاه بده، اما فرض‌ها، معیارهای تصمیم، محاسبات قابل‌بازبینی و دلایل اصلی را جدا گزارش کن. اگر داده کافی نیست، نتیجهٔ قطعی نده. یک آزمون ساده پیشنهاد کن که بتواند نتیجهٔ تو را رد یا اصلاح کند.
۰۶

زمینهٔ بزرگ، حافظهٔ کامل نیست

پنجرهٔ زمینهٔ بزرگ اجازه می‌دهد اطلاعات بیشتری وارد پردازش شود، اما تضمین نمی‌کند همهٔ جزئیات با دقت یکسان استفاده شوند. پژوهش «گم‌شده در میانه» نشان داده است که در مدل‌ها و وظایف بررسی‌شده، محل اطلاعات در متن طولانی می‌تواند بر عملکرد اثر بگذارد. این یافته را قانون ثابت همهٔ مدل‌های امروز ندانید؛ آن را دلیل طراحی آزمون پوشش قرار دهید.

برای یک بستهٔ صدصفحه‌ای، فهرست اسناد و پرسش‌های تصمیم را ابتدا مشخص کنید. از مدل بخواهید برای هر ادعا محل منبع بدهد و بخش‌های بررسی‌نشده را اعلام کند. اطلاعات متناقض، پیوست‌های تصویری و نسخه‌های قدیمی را جدا علامت بزنید. گاهی تقسیم مسئله و بازیابی بخش مرتبط از افزودن تمام اسناد به یک گفتگو کارآمدتر است.

مکث و تمرین

یک نکتهٔ مهم را در آغاز، میانه و پایان سه نسخهٔ یک متن ساختگی قرار دهید. با سؤال یکسان، میزان یافتن و ارجاع آن را مقایسه کنید؛ این آزمون کوچک را تعمیم قطعی ندهید.

۰۷

آزمایش دو تنظیم با پاسخ مرجع

برای تمرین، سه تأمین‌کنندهٔ فرضی بسازید و چهار معیار قیمت، زمان، کیفیت و ریسک وابستگی تعیین کنید. یک بار با تنظیم سریع و یک بار با تنظیم استدلالیِ واقعاً در دسترس اجرا کنید. داده و دستور را ثابت نگه دارید. پاسخ مرجع شامل جمع وزن‌ها، محدودیت بودجه و یک حالت تساوی باشد تا فقط نثر را ارزیابی نکنید.

جدول ثبت آزمایش باید تاریخ، محصول، نام مدلِ نمایش‌داده‌شده، ابزار فعال، سطح تلاشِ قابل‌تأیید، زمان و خطا را داشته باشد. اگر رابط مدل دقیق را نشان نمی‌دهد، همان ابهام را ثبت کنید. پاسخ بهتر در یک نوبت ممکن است تصادفی باشد؛ برای تصمیم سازمانی نمونه‌های متنوع و تکرار محدود لازم است.

  • پیش از اجرا معیار امتیازدهی را بنویسید.
  • تغییر هم‌زمان مدل، پرامپت و داده را انجام ندهید.
  • زمان اصلاح انسانی را کنار زمان تولید ثبت کنید.
  • نتیجه را برای همین وظیفه و همین تنظیم گزارش کنید.
۰۸

سیاست سادهٔ انتخاب مدل برای یک تیم

یک سیاست کاربردی می‌تواند بگوید: کارهای عمومی ابتدا با تنظیم سریع؛ کارهای چندقیدی با تنظیم استدلالی؛ اعداد با محاسبهٔ قابل‌بازبینی؛ اطلاعات تازه با جست‌وجو؛ دادهٔ حساس فقط در محیط مصوب. اگر خروجی معیار را نگرفت، نخست ورودی و صورت مسئله را اصلاح کنید و سپس مدل را تغییر دهید.

کاربر حرفه‌ای می‌تواند مسیر جایگزین داشته باشد، اما تغییر ابزار نباید باعث خروج داده از مرز مجاز شود. برای فرایند تکرارشونده، نسخهٔ دستور و مجموعهٔ آزمون را نگه دارید؛ تغییر مدل یا تنظیم باید با همان آزمون بررسی شود. نام جدید محصول مجوز حذف کنترل کیفیت نیست.

برای میز تصمیم: مدل بهتر، ابزار درست، دادهٔ کافی و فرایند بازبینی چهار عامل مکمل‌اند؛ هیچ‌کدام جای دیگری را نمی‌گیرد.

دانش خود را بسنجید

پیش از رفتن به فصل بعد

۱. نوشتن «بالاترین effort را فعال کن» چه چیزی را ثابت می‌کند؟

۲. بهترین معیار برای مدل مناسب چیست؟

چک‌لیست پایان فصل

پیشرفت و تیک‌ها فقط در همین مرورگر ذخیره می‌شوند؛ تکمیل فصل به‌معنای گواهی مهارت نیست.

پیوندهای این فصل

منابع برای بررسی مستقیم