بعد از این فصل میتوانید…
- مدل و سطح تلاش را با نیاز کار تطبیق میدهید.
- تنظیم واقعی را از دستور زبانی تشخیص میدهید.
- کیفیت، زمان و هزینه را همزمان میسنجید.
چرا یک مدل برای همهٔ کارها کافی نیست؟
خانوادههای مدل از نظر سرعت، کیفیت استدلال، پردازش تصویر، طول زمینه، ابزار قابلاستفاده و هزینه تفاوت دارند. نامی که در اپلیکیشن میبینید ممکن است یک مدل مشخص یا یک حالت مسیریابی خودکار باشد. مدلهای خانوادهٔ GPT در OpenAI، Claude در Anthropic، Grok در xAI و Gemini در Google را با محصولی که آنها را عرضه میکند اشتباه نگیرید.
بهجای حفظکردن فهرست نامهایی که مرتب عوض میشود، سه سبد بسازید: کارهای سریع و کمریسک، تحلیلهای چندمرحلهای و کارهای وابسته به ابزار یا دادهٔ خاص. برای بازنویسی یک دعوتنامه، انتخاب سنگینترین مدل معمولاً اولین نیاز نیست؛ برای بررسی مفروضات یک تصمیم پیچیده، مدل مناسب و زمان بررسی بیشتر میتواند مفید باشد. نتیجه را با آزمون خودتان بسنجید.
| نوع کار | انتخاب آغازین پیشنهادی | معیار پذیرش |
|---|---|---|
| بازنویسی و قالببندی | مدل سریع با دستور روشن | حفظ معنا، لحن و نامها |
| مقایسهٔ چند گزینه و محدودیت | مدل استدلالیِ در دسترس | پوشش قیود و آزمون تناقض |
| اطلاعات تازه | مدل همراه ابزار جستوجوی فعال | منبع اولیه و تاریخ معتبر |
| محاسبات جدولی | ابزار محاسبه همراه مدل | تطبیق فرمول و عدد با نمونهٔ مرجع |
| سند بسیار طولانی | مدیریت زمینه و بازیابی مناسب | پوشش بخشها و ارجاع دقیق |
نامهای واقعی مدلها؛ نمونهٔ مستند در ۲۰ سپتامبر ۲۰۲۶
برای خواندن فهرست مدلها، نام خانواده، نسخه و شناسهٔ فنی را جدا ببینید. جدول زیر نمونههایی است که در بازبینی ۲۰ سپتامبر ۲۰۲۶ در فهرست رسمی API سازندگان دیده شدند؛ فهرست کامل بازار یا تضمین دسترسی حساب شما نیست. وجود یک مدل در API به معنای نمایش همان نام در اپلیکیشن ChatGPT، Claude، Grok یا Gemini نیست. پلن، منطقه، نقش و سیاست سازمان بر دسترسی محصول اثر دارند.
ستون تمرین، پیشنهاد آموزشی این دوره برای مقایسه است و رتبهبندی مستقل مدلها محسوب نمیشود. در خانوادهٔ Claude، Opus، Sonnet و Haiku نام ردههای متفاوتاند؛ در Gemini، Pro و Flash نیز نام پلن اشتراک نیستند. پسوند preview در شناسهٔ Gemini 3.1 Pro را حفظ کنید تا نمونهٔ پیشنمایش را با نسخهٔ پایدار اشتباه نگیرید. پیش از خرید یا اتصال، لینک فهرست رسمی انتهای درس را دوباره باز کنید.
| سازنده و نمونهٔ مدل | شناسهٔ درجشده در API | تمرین پیشنهادی برای مقایسه |
|---|---|---|
| OpenAI؛ GPT-6 Astra | gpt-6-astra | بررسی چندمرحلهای گزینهها و قیود یک تصمیم |
| OpenAI؛ GPT-5.6 Sol / Terra / Luna | gpt-5.6-sol / gpt-5.6-terra / gpt-5.6-luna | مقایسهٔ کیفیت، زمان و هزینه روی گزارش تکراری |
| Anthropic؛ Claude Opus 5 / Sonnet 5 | claude-opus-5 / claude-sonnet-5 | تحلیل سند و نقد پیشنهاد با ورودی یکسان |
| Anthropic؛ Claude Haiku 4.5 | claude-haiku-4-5-20251001 | کار محدود مانند طبقهبندی یا خلاصهٔ کوتاه |
| xAI؛ Grok 4.6 | grok-4.6 | پاسخ تحلیلی؛ جستوجوی وب فقط با ابزار فعال |
| Google؛ Gemini 3.1 Pro — Preview | gemini-3.1-pro-preview | مسئلهٔ چندقیدی با کنترل فرض و پاسخ مرجع |
| Google؛ Gemini 3.8 Flash | gemini-3.8-flash | مقایسهٔ سرعت و کیفیت در کار پرتکرار |
مکث و تمرین
فهرست مدلهای حساب خود را باز کنید و فقط نامهایی را که واقعاً میبینید ثبت کنید. یکی را با جدول تطبیق دهید. اگر نام متفاوت یا حالت Auto میبینید، همان را بنویسید و مدل پشت آن را حدس نزنید. برای تمرین کلاس نیازی به خرید API نیست.
Effort چیست و چگونه تنظیم میشود؟
Effort یا سطح تلاش در مدلهای پشتیبانیشده، تنظیمی برای میزان کار محاسباتی یا استدلالی مدل است. دامنه و نام گزینهها به مدل و محصول وابسته است؛ همهٔ مدلها گزینههای یکسان ندارند. افزایش آن میتواند زمان و هزینه را تغییر دهد و برای بعضی مسائل سودمند باشد، اما صحت را تضمین نمیکند.
اگر رابط شما کنترل تلاش یا تفکر دارد، همان کنترل را انتخاب و ثبت کنید. در API، توسعهدهنده باید پارامتر مستند و پشتیبانیشدهٔ همان مدل را تنظیم کند. نوشتن «effort را روی بالاترین مقدار بگذار» در متن، شاهد تغییر تنظیم نیست. درخواست «پاسخ را با دقت بررسی کن» میتواند راهنمای کار باشد، ولی با تغییر واقعی پارامتر تفاوت دارد.
برای میز تصمیم: تنظیم واقعی را از رابط یا پیکربندی معتبر میفهمیم؛ ادعای مدل دربارهٔ تنظیم خودش کافی نیست.
گزینههای واقعی Effort؛ جدول را مدلبهمدل بخوانید
low، medium و high بهترتیب برچسب تلاش کم، متوسط و زیاد در همان سامانهاند؛ xhigh و max، در مدلهای پشتیبانیشده، سطوح بالاترند. none و minimal نیز فقط وقتی معتبرند که مستند همان مدل آنها را بپذیرد. این واژهها واحد مشترک اندازهگیری نیستند: high در دو سازنده یا حتی دو نسخه الزاماً زمان، توکن، کیفیت یا هزینهٔ برابر ندارد.
نمونههای زیر از مستندات رسمی API در ۲۰ سپتامبر ۲۰۲۶ گرفته شدهاند. کاربر وب یا گوشی فقط از کنترل واقعاً موجود در حساب خود استفاده کند؛ نام گزینهٔ رابط ممکن است با پارامتر فنی متفاوت باشد. برای یک کار ساده میتوانید سطح پایینترِ پشتیبانیشده را آزمایش کنید و برای مسئلهٔ چندقیدی با شاهد کیفیت بالاتر بروید. گزینهٔ ناشناخته را به مدل تحمیل نکنید و پذیرش آن را از متن پاسخ استنتاج نکنید.
- نام مدل، سطح انتخابشده و ابزار فعال را در برگهٔ آزمایش ثبت کنید.
- سقف خروجی مانند max_tokens یا max_output_tokens با effort یکی نیست؛ سقف کم ممکن است پاسخ را قطع کند.
- none به معنای نبود تمام توان تحلیل یا تضمین پاسخ آنی نیست؛ معنای آن را در مستند همان مدل بخوانید.
- اگر یک سرویس گزینهٔ دیگری مانند ultra نشان داد، آن را فقط برای همان سرویس و مدل مستند کنید؛ جدول جهانی و یکسانی وجود ندارد.
| مدل و تنظیم مستند | نمونهٔ مقادیر پشتیبانیشده | مرز مهم |
|---|---|---|
| GPT-6 Astra؛ reasoning.effort | low / medium / high / xhigh / max | none در مستند این مدل پشتیبانی نمیشود. |
| GPT-5.6 Sol؛ reasoning.effort | none / low / medium / high / xhigh / max | این فهرست را به همهٔ مدلهای GPT تعمیم ندهید. |
| Claude Opus 5 و Sonnet 5؛ output_config.effort | low / medium / high / xhigh / max | Haiku 4.5 همین پارامتر effort را پشتیبانی نمیکند؛ adaptive نام حالت thinking است، نه مقدار effort. |
| Grok 4.6؛ reasoning_effort | low / medium / high / xhigh | طبق مستند، reasoning غیرفعال نمیشود؛ none گزینهٔ این مثال نیست. |
| Gemini 3.8 Flash و 3.1 Pro Preview؛ thinking_level در Interactions API | low / medium / high | نام پارامتر و رابط API را با نسخهٔ مورد استفاده تطبیق دهید. |
| Gemini 3.6 Flash؛ thinking_level در Interactions API | minimal / low / medium / high | minimal در این مثال مستند است؛ آن را برای 3.8 Flash فرض نکنید. |
برای میز تصمیم: مقایسهٔ درست این است: آیا همین کار، با همین داده و همین مدل، در سطح متفاوت خروجی بهتری میدهد؟ برابری نام گزینهها، برابری توان مدلها را ثابت نمیکند.
استدلال بیشتر با جواب بلندتر یکی نیست
مدل ممکن است پاسخ کوتاه و دقیقی بدهد، درحالیکه کار محاسباتی بیشتری انجام داده است؛ یا متن بسیار بلندی تولید کند که مسئله را حل نکرده باشد. طول پاسخ، زمان انتظار و نمایش عبارت «در حال فکرکردن» بهتنهایی معیار صحت نیست. از مدل خروجی قابلبررسی بخواهید: فرضها، محاسبهٔ خلاصه، شواهد و موارد نامطمئن.
برای ارزیابی لازم نیست جریان خصوصی و ریزِ تفکر مدل را درخواست کنید. توضیح کوتاه منطق تصمیم، فرمول استفادهشده و آزمون سازگاری برای بازبینی مفیدتر است. مثلاً در مقایسهٔ تأمینکننده، جدول امتیاز و حساسیت وزنها را بخواهید؛ این خروجی را میتوان مستقل محاسبه کرد و به هیئتمدیره نشان داد.
پاسخ نهایی را کوتاه بده، اما فرضها، معیارهای تصمیم، محاسبات قابلبازبینی و دلایل اصلی را جدا گزارش کن. اگر داده کافی نیست، نتیجهٔ قطعی نده. یک آزمون ساده پیشنهاد کن که بتواند نتیجهٔ تو را رد یا اصلاح کند.
زمینهٔ بزرگ، حافظهٔ کامل نیست
پنجرهٔ زمینهٔ بزرگ اجازه میدهد اطلاعات بیشتری وارد پردازش شود، اما تضمین نمیکند همهٔ جزئیات با دقت یکسان استفاده شوند. پژوهش «گمشده در میانه» نشان داده است که در مدلها و وظایف بررسیشده، محل اطلاعات در متن طولانی میتواند بر عملکرد اثر بگذارد. این یافته را قانون ثابت همهٔ مدلهای امروز ندانید؛ آن را دلیل طراحی آزمون پوشش قرار دهید.
برای یک بستهٔ صدصفحهای، فهرست اسناد و پرسشهای تصمیم را ابتدا مشخص کنید. از مدل بخواهید برای هر ادعا محل منبع بدهد و بخشهای بررسینشده را اعلام کند. اطلاعات متناقض، پیوستهای تصویری و نسخههای قدیمی را جدا علامت بزنید. گاهی تقسیم مسئله و بازیابی بخش مرتبط از افزودن تمام اسناد به یک گفتگو کارآمدتر است.
مکث و تمرین
یک نکتهٔ مهم را در آغاز، میانه و پایان سه نسخهٔ یک متن ساختگی قرار دهید. با سؤال یکسان، میزان یافتن و ارجاع آن را مقایسه کنید؛ این آزمون کوچک را تعمیم قطعی ندهید.
آزمایش دو تنظیم با پاسخ مرجع
برای تمرین، سه تأمینکنندهٔ فرضی بسازید و چهار معیار قیمت، زمان، کیفیت و ریسک وابستگی تعیین کنید. یک بار با تنظیم سریع و یک بار با تنظیم استدلالیِ واقعاً در دسترس اجرا کنید. داده و دستور را ثابت نگه دارید. پاسخ مرجع شامل جمع وزنها، محدودیت بودجه و یک حالت تساوی باشد تا فقط نثر را ارزیابی نکنید.
جدول ثبت آزمایش باید تاریخ، محصول، نام مدلِ نمایشدادهشده، ابزار فعال، سطح تلاشِ قابلتأیید، زمان و خطا را داشته باشد. اگر رابط مدل دقیق را نشان نمیدهد، همان ابهام را ثبت کنید. پاسخ بهتر در یک نوبت ممکن است تصادفی باشد؛ برای تصمیم سازمانی نمونههای متنوع و تکرار محدود لازم است.
- پیش از اجرا معیار امتیازدهی را بنویسید.
- تغییر همزمان مدل، پرامپت و داده را انجام ندهید.
- زمان اصلاح انسانی را کنار زمان تولید ثبت کنید.
- نتیجه را برای همین وظیفه و همین تنظیم گزارش کنید.
سیاست سادهٔ انتخاب مدل برای یک تیم
یک سیاست کاربردی میتواند بگوید: کارهای عمومی ابتدا با تنظیم سریع؛ کارهای چندقیدی با تنظیم استدلالی؛ اعداد با محاسبهٔ قابلبازبینی؛ اطلاعات تازه با جستوجو؛ دادهٔ حساس فقط در محیط مصوب. اگر خروجی معیار را نگرفت، نخست ورودی و صورت مسئله را اصلاح کنید و سپس مدل را تغییر دهید.
کاربر حرفهای میتواند مسیر جایگزین داشته باشد، اما تغییر ابزار نباید باعث خروج داده از مرز مجاز شود. برای فرایند تکرارشونده، نسخهٔ دستور و مجموعهٔ آزمون را نگه دارید؛ تغییر مدل یا تنظیم باید با همان آزمون بررسی شود. نام جدید محصول مجوز حذف کنترل کیفیت نیست.
برای میز تصمیم: مدل بهتر، ابزار درست، دادهٔ کافی و فرایند بازبینی چهار عامل مکملاند؛ هیچکدام جای دیگری را نمیگیرد.
دانش خود را بسنجید
پیش از رفتن به فصل بعد
چکلیست پایان فصل
پیشرفت و تیکها فقط در همین مرورگر ذخیره میشوند؛ تکمیل فصل بهمعنای گواهی مهارت نیست.
پیوندهای این فصل
منابع برای بررسی مستقیم
- OpenAI؛ فهرست رسمی مدلها و شناسههای API
- OpenAI؛ راهنمای مدلهای استدلالی
- Anthropic؛ فهرست رسمی مدلهای Claude
- Anthropic؛ راهنمای Effort
- xAI؛ فهرست مدلهای Grok
- xAI؛ گزینههای reasoning در Grok
- Google؛ فهرست مدلهای Gemini API
- Google؛ تنظیم thinking در Gemini API
- پژوهش Lost in the Middle؛ محدودیت استفاده از زمینهٔ طولانی