Grok 4.3 / 4.5 ベンチマーク結果

reasoning_effort 別のレイテンシ・スコア・トークン数比較

生データ(全レコード)
datasetmodeleffortnerrors avg_latency (s)avg_scoreavg_tokensavg_reasoning_tokens