پرش به محتوای اصلی
OpenAI

۲۲ مرداد ۱۴۰۵

AI کاربردی

The builder’s guide to GPT‑5.6

Technical lessons from startups in production

در حال بارگذاری…

GPT‑5.6 sets a new standard for price-performance

The GPT‑5.6 model family makes frontier-level agent performance dramatically more affordable, while also advancing the frontier of what is possible.

In this guide, we show how startups are using smarter model selection and new API controls that help with reasoning continuity, multi-agent orchestration, and programmatic tool calling to build faster, more capable agents at a fraction of the cost.

A better out-of-the-box experience

Since GPT‑5, each model generation has sought to tackle longer-horizon tasks with fewer tokens. GPT‑5.6 continues that trajectory: stronger agent performance, lower costs, with minimal changes to the underlying harness.

The improvements in top-line cost efficiency are compounded with increased accuracy at lower reasoning efforts. For example, on Agents’ Last Exam, GPT‑5.6 Sol at “low” reasoning outperformed GPT‑5.5 at “high” reasoning when the harness was kept constant. We’ve seen similar success stories in production testing where startups report seeing significant cost improvements across a range of workflows by reducing the reasoning effort from the prior defaults.

GPT‑5.6 را مستقیماً در چارچوب آزمون خود قرار دادیم و تلاش استدلالی کم، بهترین نتایج ما را رقم زد. می‌دانست چه زمانی داده‌ای در کار نیست، سرنخ‌های نادرست را دنبال نمی‌کرد و با توکن‌های کمتر به پاسخ درست می‌رسید.
— ایزی میلر، سرپرست پژوهش هوش مصنوعی، Hex(در یک پنجره جدید باز می‌شود)

Model Selection

Historically, upgrading to a flagship model at the highest reasoning available has been the best option for long-horizon use cases. This has been in large part due to these models being significantly more capable than cost-optimized models at handling longer contexts and tool calling. This has changed with the 5.6-family: with more test-time compute, Luna and Terra can often perform similar to GPT‑5.4 and 5.5 while being significantly cheaper.

1 از 3
Luna با یک‌هجدهم هزینه، ۹۸٪ دقت استخراج GPT‑5.5 را حفظ می‌کند. به این ترتیب، عامل‌های ما با هزینه‌ای مقرون‌به‌صرفه، درک باکیفیتی از اسناد دارند و می‌توانند از آن در گردش‌کارهای بسیار بیشتری استفاده کنند.
— سرهی شوخولیف، سرپرست مهندسی عامل‌ها، Hypha(در یک پنجره جدید باز می‌شود)

Consider tasks in BrowseComp: a search-based benchmark that tests a model’s ability to search for obscure facts. Three months ago, GPT‑5.5 (Extra High) scored 84.36% on this benchmark for a total cost of $33.27. At launch, GPT‑5.6 Luna (Extra High) delivers essentially the same performance, scoring 84.04% at a cost of $1.33. We’ve since reduced prices further. Read more on our latest price cuts.

The smaller 5.6-family models are a strong fit for high-volume workloads, latency-sensitive interactions, and repeated steps within agentic workflows. For example, if you’re operating a legal-tech startup that parses handwritten memos prior to agentic analysis, instead of using a frontier model for the entire use case, you can now use Terra or Luna for extraction and register significant cost savings.

Evolving the Responses API to architect more efficient agents

In addition to making GPT‑5.6 more performant out of the box, we also shipped new primitives to the Responses API to unlock further gains. We trained GPT‑5.6 end-to-end with three complementary architectural interventions that enable agents to operate more efficiently:

  1. Reuse work already performed: by allowing reasoning to be persisted(در یک پنجره جدید باز می‌شود) across model turns and using native compaction(در یک پنجره جدید باز می‌شود) to compress long-running conversations, the model can maintain coherence in its work across longer task horizons without getting confused or having to reconstruct prior context.
  2. Parallel decomposition where appropriate: using native multi-agent orchestration(در یک پنجره جدید باز می‌شود) allows coordinating multiple agents across parallel workstreams to finish complex tasks faster.
  3. Move deterministic work into code: using programmatic tool calling(در یک پنجره جدید باز می‌شود) to filter, aggregate, and orchestrate tool outputs outside the model’s context window, reserving model tokens for judgment and reducing cost, latency, and context rot.

استفاده هم‌زمان از این قابلیت‌ها می‌تواند تفاوت چشمگیری ایجاد کند. برای نمونه، GPT‑5.6 Sol در ARC-AGI-3 و با چارچوب آزمون استاندارد، امتیاز ۱۳٫۳٪ را کسب کرد. اما پس از فعال‌سازی حفظ استدلال و فشرده‌سازی، امتیاز به ۳۸٫۳٪ جهش کرد؛ آن هم با حدود ۶ برابر توکن خروجی کمتر. بدون هیچ تغییری در مدل، عملکرد تقریباً سه برابر شد. می‌توانید جزئیات بیشتری را در بررسی چارچوب آزمون ARC-AGI-3 ما بخوانید.

فراخوانی برنامه‌نویسی‌شده ابزار

گردش‌کارهای عاملی اغلب شامل دو نوع کار هستند:

  1. وظایفی که به قضاوت نیاز دارند
  2. کارهایی که عمدتاً مستلزم جابه‌جایی، پالایش و ترکیب داده‌ها هستند

وقتی عاملی ۱۰۰ سند ثبتی را بازیابی و براساس تاریخ پالایش می‌کند و تراکنش‌های مرتبط را می‌یابد، مدل نباید ناچار باشد در پنجره زمینه خود درباره تک‌تک نتایج میانی استدلال کند. فراخوانی برنامه‌نویسی‌شده ابزار به GPT‑5.6 امکان می‌دهد برای هماهنگ‌سازی ابزارها، اجرای موازی فراخوانی‌های مستقل و پردازش خروجی آن‌ها بیرون از پنجره زمینه، کد JavaScript بنویسد. در نتیجه مدل بر کاری تمرکز می‌کند که به هوشمندی نیاز دارد: قضاوت.

در پژوهش مالی، بخش دشوار کار استخراج مطمئن اسناد ثبتی، هماهنگ‌کردن ابزارها و بررسی دقیق اعداد است. در ارزیابی‌های ما، GPT‑5.6 با فراخوانی برنامه‌نویسی‌شده ابزار، در حالی که ۲۱٪ توکن ورودی کمتری مصرف می‌کرد، به سطح کیفیت تعیین‌شده در معیار ارزیابی ما دست یافت. این همان تفاوت میان عاملی است که می‌تواند درباره پژوهش مالی صحبت کند و عاملی که واقعاً می‌تواند آن را انجام دهد.
— الکس وانگ، هوش مصنوعی کاربردی، Rogo(در یک پنجره جدید باز می‌شود)

چندعاملی

در وظایف پیچیده‌ای که قابلیت اجرای موازی دارند، توزیع اقدام‌ها و استدلال میان چند جریان کاری عاملی، هم انجام کار را سریع‌تر می‌کند و هم هوشمندی را افزایش می‌دهد. در این ساختارها، عامل اصلی وظیفه هماهنگ‌سازی زیرعامل‌ها و واگذاری وظایف به آن‌ها را بر عهده دارد. زیرعامل‌ها اهداف خود را به‌صورت موازی دنبال می‌کنند و در پایان خروجی را برای تلفیق نهایی به عامل اصلی بازمی‌گردانند. تیم‌ها می‌توانند با فعال‌کردن قابلیت چندعاملی(در یک پنجره جدید باز می‌شود) در API پاسخ‌ها، به‌صورت بومی از آن بهره ببرند. تنظیم قابلیت Ultra در ChatGPT نیز به همین شیوه کار می‌کند.

1 از 2
Qualia گروه‌هایی از عامل‌ها را برای مسائل پژوهشی با پاسخ باز به کار می‌گیرد و GPT‑5.6 Sol دقیقاً همان چیزی بود که می‌خواستیم. این مدل نسبت به GPT‑5.5 پیشرفت محسوسی داشت، تقریباً از همه مدل‌های دیگری که آزمودیم سریع‌تر کار را تمام کرد و خیلی زود به مدل منتخب ما در OpenAI تبدیل شد.
— ای چی، بنیان‌گذار Quadrillion(در یک پنجره جدید باز می‌شود)

GPT‑5.6 به‌خوبی تشخیص می‌دهد چه تعداد زیرعامل مناسب است و چه زمانی باید آن‌ها را ایجاد کند؛ بااین‌حال، رفتار چندعاملی را می‌توان به‌راحتی هدایت کرد. اگر به مدل بگویید چه زمانی زیرعامل‌ها را فراخوانی کند، احتمالاً عامل‌ها را فقط در موقعیت‌هایی ایجاد می‌کند که مصرف توکن بیشتر به عملکرد بهتر منجر شود.

ذخیره‌سازی پرامپت در حافظهٔ نهان

در سراسر خانواده مدل‌ها، زمان ماندگاری ذخیره‌سازی پرامپت در حافظهٔ نهان به حداقل ۳۰ دقیقه افزایش یافته و اکنون می‌توان نقاط شکست حافظه نهان را به‌صورت قطعی در پنجره زمینه مدل تعیین کرد. این قابلیت به استارتاپ‌ها امکان داده است نرخ اصابت حافظه نهان خود را به‌طور چشمگیری بهبود دهند.

به یک اعلان مشترک ۲۹٬۰۰۰ توکنی، نقاط شکست حافظه نهان و کلیدهای مختص هر فضای کاری افزودیم و ورودی بدون حافظه نهان را ۲۸٪ کاهش دادیم. پنجره ۳۰دقیقه‌ای حافظه نهان نیز امکان مهمی فراهم کرد: عامل‌های ما می‌توانستند به‌جای شروع دوباره از صفر، از همان زمینه در اجراهای مختلف دوباره استفاده کنند.
— لورنزو جنتیله، مهندس هوش مصنوعی، Ploy(در یک پنجره جدید باز می‌شود)

علاوه بر تعیین نقاط شکست حافظه نهان، ادامه استفاده از یک prompt_cache_key(در یک پنجره جدید باز می‌شود) مناسب، احتمال رسیدن درخواست‌ها به همان موتور استنتاجی را افزایش می‌دهد که پیش‌تر همان پیشوند را پردازش کرده است و در نتیجه تأخیر کاهش می‌یابد.

جمع‌بندی

نکته برجسته در همه این نمونه‌ها، میزان تغییر اقتصاد ساخت عامل‌هاست.

کاربردهایی که زمانی در هر مرحله به یک مدل پیشرو نیاز داشتند، اکنون می‌توانند با مدل‌های کوچک‌تر، تنظیم تلاش استدلالی و انتخاب‌های معماری کارآمد، نتایجی مشابه یا بهتر را با کسری از هزینه به دست آورند.

مشتاقیم ببینیم شما چه می‌سازید!

  • ۲۰۲۶
  • پلتفرم API

درباره نویسندگان

این راهنما را سامارث مادورو(در یک پنجره جدید باز می‌شود)، پراشانت میتال(در یک پنجره جدید باز می‌شود)، دیو لئو(در یک پنجره جدید باز می‌شود) و جولین رایمن(در یک پنجره جدید باز می‌شود) بر پایه تجربه همکاری نزدیک با استارتاپ‌هایی تدوین کرده‌اند که از مراحل اولیه آزمون تا محیط عملیاتی، محصولات خود را بر بستر GPT‑5.6 ساخته‌اند.