قابلیت Reasoning جمنای؛ انتخاب Low، Medium یا High
فهرست مطالب
- قابلیت Reasoning در جمنای چیست؟
- تفاوت Low، Medium و High چیست؟
- چه زمانی Reasoning واقعاً ارزش دارد؟
- چگونه برای استدلال بهتر پرامپت بنویسیم؟
- استفاده از Reasoning در Google AI Studio
- تنظیم thinking_level در Gemini API
- Thinking چه اثری بر هزینه و سرعت دارد؟
- چگونه بفهمیم Reasoning بهتر شده است؟
- خطاهای رایج
- جمعبندی؛ از Medium شروع کنید و با آزمون تصمیم بگیرید
- سوالات متداول
- منابع
پاسخ کوتاه: قابلیت Reasoning در جمنای به مدل اجازه میدهد پیش از پاسخ نهایی، تلاش محاسباتی بیشتری برای مسئلههای چندمرحلهای صرف کند. در Gemini 3.8 Flash سطح Medium پیشفرض است؛ Low برای سرعت و هزینه کمتر و High برای مسئلههای واقعاً دشوار مناسبتر است.
قابلیت Reasoning در جمنای چیست؟
Reasoning یا «استدلال» در مدلهای جمنای به فرایندی گفته میشود که مدل پیش از تولید پاسخ نهایی، مسئله را با تلاش محاسباتی و مراحل داخلی بیشتری بررسی میکند. این قابلیت برای ریاضی، کدنویسی، تحلیل چندمنبعی، برنامهریزی و کارهای عاملمحور مفید است؛ اما هر پرسش سادهای به بیشترین سطح آن نیاز ندارد.
طبق مستندات رسمی Gemini Thinking، مدلهای جدید جمنای بهصورت پویا فکر میکنند و مقدار تلاش را با پیچیدگی درخواست هماهنگ میکنند. توسعهدهنده میتواند این رفتار را با پارامتر thinking_level کنترل کند.
یک نکته مهم: خلاصه Thought که API میتواند برگرداند، «خلاصهای از استدلال» است، نه متن کامل فرایند داخلی یا زنجیره فکر خام. کیفیت پاسخ را باید با خروجی و آزمون سنجید، نه با طول یا ظاهر این خلاصه.
تفاوت Low، Medium و High چیست؟
| سطح | مناسب برای | ملاحظه |
|---|---|---|
| Low | پاسخ سریع، خلاصهسازی، طبقهبندی، نوشتن پیشنویس و ابزارهای کممرحله | تأخیر و هزینه کمتر؛ ممکن است برای مسئله دشوار سطحی باشد. |
| Medium | بیشتر کارهای عمومی، تحلیل، کدنویسی و عاملهای چندمرحلهای معمول | سطح پیشفرض Gemini 3.8 Flash و انتخاب مناسب برای شروع. |
| High | ریاضی سخت، دیباگ پیچیده، برنامهریزی طولانی و مسئلههای با محدودیتهای زیاد | ممکن است زمان رسیدن به پاسخ و مصرف توکن را افزایش دهد. |
در Gemini 3.8 Flash سطح minimal پشتیبانی نمیشود و استفاده از آن خطا میدهد. سه سطح مجاز Low، Medium و High هستند و Medium بهصورت پیشفرض فعال است.

چه زمانی Reasoning واقعاً ارزش دارد؟
- وقتی مسئله چند شرط وابسته دارد و پاسخ باید همه آنها را همزمان رعایت کند.
- وقتی مدل باید چند فایل، منبع یا مرحله ابزار را ترکیب کند.
- برای دیباگ خطایی که علت آن با یک نگاه مشخص نیست.
- برای طراحی برنامهای که محدودیت زمان، هزینه، منابع و ریسک دارد.
- برای تحلیل سناریو و مقایسه گزینهها با معیارهای از پیش تعیینشده.
برای تبدیل متن به جدول، اصلاح لحن، استخراج چند فیلد یا پاسخ کوتاه factual، ابتدا Low یا Medium را آزمایش کنید. اگر خروجی در آزمون واقعی شکست میخورد، سطح را بالا ببرید؛ نه اینکه از ابتدا همه درخواستها را روی High بگذارید.
چگونه برای استدلال بهتر پرامپت بنویسیم؟
مدل استدلالی هم به مسئله مبهم پاسخ مبهم میدهد. یک پرامپت خوب پنج جزء دارد:
- هدف: دقیقاً چه تصمیم یا خروجی میخواهید؟
- زمینه: اطلاعات لازم و مرز مسئله چیست؟
- معیارها: پاسخ خوب با چه شاخصی سنجیده میشود؟
- محدودیتها: زمان، بودجه، فناوری، طول یا ریسک چه حدی دارد؟
- قالب خروجی: جدول، JSON، چکلیست یا توضیح کوتاه؟
نمونه پرامپت ضعیف: «برای اپ من معماری پیشنهاد بده.»
نمونه بهتر:
برای یک اپ فارسی با ۲۰ هزار کاربر ماهانه، دو معماری کمهزینه پیشنهاد بده. معیارها: هزینه زیر ۳۰۰ دلار در ماه، پشتیبانگیری روزانه و امکان رشد سهبرابری. ابتدا فرضها را فهرست کن، سپس گزینهها را در جدول مقایسه کن و در پایان سه ریسک اصلی انتخاب برتر را بنویس. اگر دادهای کافی نیست، آن را صریح مشخص کن.
لازم نیست از مدل بخواهید «تمام زنجیره فکر مخفی را نمایش بدهد». درخواست فرضها، شواهد، محاسبات قابل بررسی، نقاط ابهام و آزمون نتیجه، هم مفیدتر است و هم خروجی قابل ارزیابیتری میسازد.
استفاده از Reasoning در Google AI Studio
- Google AI Studio را باز و مدل موردنظر را انتخاب کنید.
- در تنظیمات مدل، بخش Thinking یا Thinking level را پیدا کنید؛ محل دقیق آن ممکن است با نسخه رابط تغییر کند.
- با Medium شروع کنید و یک نمونه واقعی اما غیرحساس اجرا کنید.
- زمان پاسخ، کیفیت، خطا و میزان استفاده را ثبت کنید.
- همان پرامپت را با Low و High تکرار و خروجیها را با معیار ثابت مقایسه کنید.
اگر در رابط مصرفکننده Gemini انتخاب سطح را نمیبینید، به این معنی نیست که مدل هیچ استدلالی انجام نمیدهد؛ کنترل دقیق پارامترها بیشتر در AI Studio و API در دسترس توسعهدهندگان است.
تنظیم thinking_level در Gemini API
در SDK جدید گوگل میتوانید سطح Thinking را در Generation Config تعیین کنید. نمونه پایتون برای Gemini 3.8 Flash:
from google import genai
client = genai.Client()
interaction = client.interactions.create(
model="gemini-3.8-flash",
input="سه علت محتمل این خطا را اولویتبندی و برای هرکدام یک تست بنویس.",
generation_config={
"thinking_level": "medium"
}
)
print(interaction.output_text)
برای Generate Content API نیز میتوان از ThinkingConfig استفاده کرد. thinking_level و پارامتر قدیمی thinking_budget را همزمان نفرستید؛ این ترکیب ممکن است خطای درخواست ایجاد کند.
اگر برنامه شما از سازگاری OpenAI استفاده میکند، مستندات گوگل نگاشت reasoning_effort را توضیح میدهد. در هر حالت، نام پارامتر را با همان API و نسخه SDK که واقعاً استفاده میکنید تطبیق دهید.
Thinking چه اثری بر هزینه و سرعت دارد؟
توکنهای Thinking در هزینه خروجی محاسبه میشوند، حتی اگر API فقط خلاصهای از استدلال را نمایش دهد. سطح High میتواند زمان رسیدن به اولین توکن پاسخ و مصرف کل را افزایش دهد؛ بهویژه وقتی مدل چند بار ابزار فراخوانی میکند یا مسیرهای بیشتری را میآزماید.
برای کنترل هزینه:
- کار ساده را با Low و کار عمومی را با Medium شروع کنید.
- High را فقط برای وظیفهای فعال کنید که آزمون نشان داده در سطح پایینتر کیفیت کافی ندارد.
- ورودیهای تکراری را کوتاه کنید و در پروژه بزرگ از Context Caching مناسب استفاده کنید.
- مصرف
total_thought_tokensوtotal_tokensرا در پاسخ API ثبت کنید. - هزینه را به ازای «وظیفه موفق» بسنجید، نه فقط قیمت هر میلیون توکن.
صفحه قیمت فعلی Gemini 3.8 Flash میگوید توکنهای Thinking در قیمت خروجی قرار میگیرند. تعرفه و سهمیه ممکن است تغییر کند، بنابراین داشبورد همان روز را مرجع نهایی بگیرید.
چگونه بفهمیم Reasoning بهتر شده است؟
طولانیتر بودن پاسخ یا خلاصه Thought، نشانه قطعی کیفیت نیست. یک مجموعه کوچک از وظایف واقعی بسازید و هر سطح را با معیارهای ثابت بسنجید:
- درستی پاسخ نهایی
- رعایت محدودیتها
- موفقیت آزمون کد یا محاسبه
- تعداد فراخوانی ابزار و خطاهای آن
- زمان پاسخ
- هزینه کل هر خروجی پذیرفتهشده

برای تصمیمهای حساس، پاسخ را با منبع مستقیم و متخصص انسانی بررسی کنید. Reasoning میتواند خطا را منظمتر و قانعکنندهتر بیان کند؛ بنابراین اعتماد صرف به لحن مدل خطرناک است.
خطاهای رایج
- استفاده از minimal برای 3.8 Flash: این سطح پشتیبانی نمیشود؛ Low را انتخاب کنید.
- High برای همه درخواستها: هزینه و تأخیر را بالا میبرد بدون اینکه همیشه کیفیت محسوس بهتر شود.
- ترکیب thinking_level و thinking_budget: فقط پارامتر متناسب با مدل و API خود را استفاده کنید.
- درخواست زنجیره فکر خام: بهجای آن خلاصه، فرضها، شواهد و محاسبات قابل بررسی بخواهید.
- نداشتن معیار آزمون: بدون مجموعه وظیفه و پاسخ مرجع نمیتوان سطحها را منصفانه مقایسه کرد.
برای استفاده ابزارهای توسعه گوگل روی ویندوز، راهنمای ابزارهای هوش مصنوعی گوگل در ویندوز ۱۱ و WSL را هم ببینید. اگر هدف شما تولید محتوای قابل استناد است، مقاله بهینهسازی برای پاسخهای هوش مصنوعی اهمیت ساختار و منابع قابل فهم را توضیح میدهد.
جمعبندی؛ از Medium شروع کنید و با آزمون تصمیم بگیرید
قابلیت Reasoning جمنای ابزار کنترل کیفیت، هزینه و تأخیر است؛ نه یک دکمه جادویی. برای Gemini 3.8 Flash از Medium شروع کنید، Low را برای کارهای سریع و پرتکرار و High را برای مسئلههای واقعاً دشوار آزمایش کنید.
پرامپت شفاف، معیار موفقیت و آزمون واقعی معمولاً بیشتر از درخواست «بیشتر فکر کن» کیفیت را بالا میبرند. سطحی را انتخاب کنید که با کمترین هزینه، وظیفه شما را بهطور قابل تکرار درست انجام میدهد.
سوالات متداول
سطح پیشفرض Thinking در Gemini 3.8 Flash چیست؟
طبق مستندات رسمی، سطح پیشفرض Medium است و مدل از Low، Medium و High پشتیبانی میکند.
آیا میتوان Thinking را در Gemini 3.8 Flash کاملاً خاموش کرد؟
سطح minimal در این مدل پشتیبانی نمیشود. برای کمترین تلاش و تأخیر از Low استفاده کنید، اما این به معنی خاموشی کامل استدلال نیست.
آیا High همیشه پاسخ دقیقتری میدهد؟
خیر. High برای مسئله دشوار مناسب است، اما ممکن است فقط هزینه و زمان را بالا ببرد. کیفیت را روی وظایف واقعی خود بسنجید.
توکنهای Thinking چگونه قیمتگذاری میشوند؟
توکنهای Thinking در هزینه خروجی محاسبه میشوند، حتی اگر فقط خلاصه Thought در پاسخ قابل مشاهده باشد.
آیا Thought Summary همان زنجیره فکر کامل مدل است؟
خیر. Thought Summary خلاصهای از استدلال است و متن کامل فرایند داخلی مدل محسوب نمیشود.