Model evidence

GPT-5.6 Sol, Terra, and Luna

Compare the three GPT-5.6 variants inside one published batch instead of treating Sol, Terra, and Luna as interchangeable names.

Current batch

GPT-5.6 Sol / Max has the highest measured score at 85/100. GPT-5.6 Terra / Low is the fastest measured configuration at 28m 52s. They support different decisions.

Selected evidence
Published
Aug 26, 2026, 11:00 PM UTC
Question pack
coding-fast-v4.10
Coverage
15 measured configurations
Batch
snapshot-2026-08-26T23-00-00Z-r3

Measured configurations

ConfigurationRankScoreElapsedReference costRoute
GPT-5.6 Sol / Max#185/10044m 58s$1.82Official login
GPT-5.6 Terra / Max#284/10034m 57s$1.65Official login
GPT-5.6 Sol / XHigh#383/10045m 48s$1.26Official login
GPT-5.6 Sol / High#480/10045m 2s$0.96Official login
GPT-5.6 Luna / Max#577/10040m 9s$0.16Official login
GPT-5.6 Terra / XHigh#773/10033m 20s$0.47Official login
GPT-5.6 Sol / Medium#968/10043m 38s$0.66Official login
GPT-5.6 Sol / Low#1365/10039m 5s$0.44Official login
GPT-5.6 Luna / XHigh#1564/10039m 30s$0.0715Official login
GPT-5.6 Terra / Low#1763/10028m 52s$0.21Official login
GPT-5.6 Terra / High#1862/10033m 30s$0.33Official login
GPT-5.6 Luna / High#1962/10038m 7s$0.0604Official login
GPT-5.6 Luna / Low#2450/10034m 8s$0.0193Official login
GPT-5.6 Terra / Medium#2548/10033m 45s$0.27Official login
GPT-5.6 Luna / Medium#2744/10038m 4s$0.0300Official login

Five-question profile

QuestionGPT-5.6 Sol / MaxGPT-5.6 Terra / MaxGPT-5.6 Sol / XHighGPT-5.6 Sol / HighGPT-5.6 Luna / MaxGPT-5.6 Terra / XHighGPT-5.6 Sol / MediumGPT-5.6 Sol / LowGPT-5.6 Luna / XHighGPT-5.6 Terra / LowGPT-5.6 Terra / HighGPT-5.6 Luna / HighGPT-5.6 Luna / LowGPT-5.6 Terra / MediumGPT-5.6 Luna / Medium
Black-box Regression Audit14/2017/2016/2015/2010/2012/2012/2013/209/208/209/207/206/2010/207/20
Retry Planner Counterexamples20/2017/2018/2017/2018/2015/2017/2014/2017/2015/2014/2015/2014/2013/2013/20
CI Adversarial Audit18/2018/2017/2018/2017/2019/2014/2013/2014/2013/2015/2014/2010/2015/2011/20
Transaction Regression Design17/2018/2016/2018/2016/2014/2013/2011/2011/2015/2011/2012/209/2010/200/20
Cache Regression Test Design16/2014/2016/2012/2016/2013/2012/2014/2013/2012/2013/2014/2011/200/2013/20

What the same-batch spread shows

The table keeps each available variant and effort level as a separate configuration. This makes it possible to compare Sol, Terra, and Luna like for like without assigning one family-wide score.

Compare the same effort first, then check whether a higher-scoring configuration still meets your elapsed-time requirement. Reference cost remains undecided when usage pricing coverage is absent.