Performance on gpt-5.6-sol

Real-world throughput, latency and reliability numbers measured against the BLACKBOX AI inference router under load.

gpt-5.6-sol

Capacity-discovery stress test of openai/gpt-5.6-sol served through the BLACKBOX AI router. Load was ramped from 100 → 10,000 RPM over 10 minutes and held at 10,000 RPM, with ~50k input tokens per request over a streaming connection. The run drove the router to its saturation point while measuring time-to-first-token (TTFT), end-to-end latency and error rate the whole way up.

11.9K RPM
Peak completed
throughput
592M TPM
Peak token
throughput
100.5K
Total
requests
99.36%
Success
rate
2.45s
TTFT p50
@ load

Throughput under load

The router tracked the scheduled ramp almost perfectly up to the 10k RPM target and sustained it through the hold, peaking at 11,856 completed RPM in the best 10-second bucket before reaching saturation at the 15-minute mark.

Achieved throughput
Completed requests/min · ramp 100 → 10,000 RPM, then hold
Higher is better
02k4k6k8k10k12k0m2m4m6m8m10m12m14m15m ramp ends · hold @ 10k 0m00s · 102 RPM completed (scheduled 182)0m10s · 288 RPM completed (scheduled 348)0m20s · 456 RPM completed (scheduled 512)0m30s · 618 RPM completed (scheduled 678)0m40s · 810 RPM completed (scheduled 842)0m50s · 936 RPM completed (scheduled 1,007)1m00s · 1,080 RPM completed (scheduled 1,172)1m10s · 1,350 RPM completed (scheduled 1,338)1m20s · 1,422 RPM completed (scheduled 1,502)1m30s · 1,614 RPM completed (scheduled 1,668)1m40s · 1,758 RPM completed (scheduled 1,832)1m50s · 1,938 RPM completed (scheduled 1,998)2m00s · 2,184 RPM completed (scheduled 2,162)2m10s · 2,286 RPM completed (scheduled 2,328)2m20s · 2,370 RPM completed (scheduled 2,492)2m30s · 2,562 RPM completed (scheduled 2,658)2m40s · 2,748 RPM completed (scheduled 2,822)2m50s · 3,084 RPM completed (scheduled 2,988)3m00s · 3,090 RPM completed (scheduled 3,152)3m10s · 3,300 RPM completed (scheduled 3,318)3m20s · 3,348 RPM completed (scheduled 3,482)3m30s · 3,294 RPM completed (scheduled 3,648)3m40s · 3,954 RPM completed (scheduled 3,812)3m50s · 3,798 RPM completed (scheduled 3,978)4m00s · 4,344 RPM completed (scheduled 4,142)4m10s · 4,404 RPM completed (scheduled 4,308)4m20s · 4,380 RPM completed (scheduled 4,472)4m30s · 4,524 RPM completed (scheduled 4,638)4m40s · 4,704 RPM completed (scheduled 4,802)4m50s · 4,986 RPM completed (scheduled 4,968)5m00s · 4,926 RPM completed (scheduled 5,132)5m10s · 5,340 RPM completed (scheduled 5,298)5m20s · 5,430 RPM completed (scheduled 5,462)5m30s · 5,808 RPM completed (scheduled 5,628)5m40s · 5,268 RPM completed (scheduled 5,792)5m50s · 6,012 RPM completed (scheduled 5,958)6m00s · 6,378 RPM completed (scheduled 6,122)6m10s · 6,156 RPM completed (scheduled 6,288)6m20s · 6,384 RPM completed (scheduled 6,453)6m30s · 6,720 RPM completed (scheduled 6,618)6m40s · 6,684 RPM completed (scheduled 6,782)6m50s · 6,234 RPM completed (scheduled 6,948)7m00s · 7,722 RPM completed (scheduled 7,112)7m10s · 7,128 RPM completed (scheduled 7,278)7m20s · 7,104 RPM completed (scheduled 7,442)7m30s · 7,542 RPM completed (scheduled 7,608)7m40s · 7,644 RPM completed (scheduled 7,772)7m50s · 8,022 RPM completed (scheduled 7,938)8m00s · 7,938 RPM completed (scheduled 8,102)8m10s · 8,256 RPM completed (scheduled 8,268)8m20s · 8,406 RPM completed (scheduled 8,432)8m30s · 8,430 RPM completed (scheduled 8,598)8m40s · 9,030 RPM completed (scheduled 8,762)8m50s · 8,928 RPM completed (scheduled 8,928)9m00s · 8,382 RPM completed (scheduled 9,092)9m10s · 9,564 RPM completed (scheduled 9,258)9m20s · 9,402 RPM completed (scheduled 9,422)9m30s · 9,174 RPM completed (scheduled 9,588)9m40s · 9,438 RPM completed (scheduled 9,752)9m50s · 10,488 RPM completed (scheduled 9,918)10m00s · 9,396 RPM completed (scheduled 10,000)10m10s · 10,056 RPM completed (scheduled 10,000)10m20s · 10,104 RPM completed (scheduled 10,000)10m30s · 10,056 RPM completed (scheduled 10,000)10m40s · 9,594 RPM completed (scheduled 10,000)10m50s · 10,812 RPM completed (scheduled 10,000)11m00s · 9,588 RPM completed (scheduled 10,000)11m10s · 10,176 RPM completed (scheduled 10,000)11m20s · 9,330 RPM completed (scheduled 10,000)11m30s · 10,650 RPM completed (scheduled 10,000)11m40s · 9,270 RPM completed (scheduled 10,000)11m50s · 9,942 RPM completed (scheduled 10,000)12m00s · 10,266 RPM completed (scheduled 10,000)12m10s · 9,576 RPM completed (scheduled 10,000)12m20s · 11,112 RPM completed (scheduled 10,000)12m30s · 9,774 RPM completed (scheduled 10,000)12m40s · 10,062 RPM completed (scheduled 10,000)12m50s · 9,576 RPM completed (scheduled 10,000)13m00s · 10,254 RPM completed (scheduled 10,000)13m10s · 9,924 RPM completed (scheduled 10,000)13m20s · 9,600 RPM completed (scheduled 10,000)13m30s · 10,716 RPM completed (scheduled 10,000)13m40s · 10,266 RPM completed (scheduled 10,000)13m50s · 9,216 RPM completed (scheduled 10,000)14m00s · 9,888 RPM completed (scheduled 10,000)14m10s · 10,038 RPM completed (scheduled 10,000)14m20s · 8,946 RPM completed (scheduled 10,000)14m30s · 9,600 RPM completed (scheduled 10,000)14m40s · 11,856 RPM completed (scheduled 10,000)14m50s · 10,128 RPM completed (scheduled 10,000)
Achieved (completed RPM)Scheduled RPM
Peak completed 11,856 RPM · peak dispatched 10,908 RPM · both exceed the 10k target because the 10s peak-bucket captures bursty completions. Chart ends at the 15m saturation point.

Time-to-first-token distribution

Even at full load, half of all requests began streaming in under 2.45s, and 95% within 6.51s — with 50k tokens of input per request.

TTFT percentiles
Seconds to first streamed token · 99,858 successful requests
Lower is better
min
min TTFT · 1.14s1.14s
p50
p50 TTFT · 2.45s2.45s
mean
mean TTFT · 3.32s3.32s
p95
p95 TTFT · 6.51s6.51s
p99
p99 TTFT · 15.82s15.82s
min 1.14s · p50 2.45s · mean 3.32s · p95 6.51s · p99 15.82s. End-to-end latency tracked TTFT closely (p50 2.52s · p95 6.60s) since responses were short.

Reliability

Across all 100,500 requests driven at up to 10k RPM, only 613 returned a real error — a 0.61% error rate, dominated by HTTP 400s (601) with a handful of timeouts.

Request outcomes
100,500 total requests
Higher is better
99.36% success · 99,8580.61% error · 613
Error breakdown — http_400: 601 · timeout: 11 · empty_stream: 1 · cancelled_after_abort: 29. HTTP status: 200 × 99,892 · 400 × 601.

Test configuration

SettingValue
Modelopenai/gpt-5.6-sol
Load profileRamp 100 → 10,000 RPM over 10 min, then hold 10,000 RPM
Input size~50,000 tokens/request
TransportStreaming, no output token cap
Rolling window30s
Total requests100,500
Run date2026-07-24

Peak throughput of 11,856 completed RPM was measured in the best 10-second bucket while holding at the 10,000 RPM target. Numbers reflect a single capacity-discovery run and represent the router’s saturation ceiling for this model and payload size — real-world sustained throughput depends on payload, region and account limits.