{
  "name": "PrivateMarketsAgentBench — Tasks vs Tools",
  "description": "Pass rate, judge score, cost, latency and tool-call efficiency for 17 frontier models executing 55 private-markets finance tasks across 7 categories through the production HenonMAX max-mode stack.",
  "run_date": "September 15, 2026",
  "stack": "Ingest v5.1 + analysis suite v4",
  "models": 17,
  "tasks": 55,
  "graded_runs": 935,
  "noise_floor_tasks": 1.8,
  "notes": "Run-to-run noise is about +/-1.8 tasks; differences of two tasks or fewer are ties.",
  "license": "CC-BY-4.0",
  "cite_as": "Henon (2026). PrivateMarketsAgentBench: Tasks vs Tools. https://henon.ai/benchmarks",
  "url": "https://henon.ai/benchmarks",
  "overall": [
    {
      "rank": 1,
      "model": "GPT-5.6 Sol",
      "provider": "Azure Foundry (OpenAI)",
      "tier": "High",
      "passed": 42,
      "total": 55,
      "passRate": 76.4,
      "score": 44.5,
      "analysis": "37/49",
      "ingest": "5/6",
      "costPerTask": 2.76,
      "costPerSuite": 152,
      "costPerPass": 3.61,
      "latency": 90,
      "tools": 28.1
    },
    {
      "rank": 2,
      "model": "GPT-5.5",
      "provider": "Azure Foundry (OpenAI)",
      "tier": "High",
      "passed": 42,
      "total": 55,
      "passRate": 76.4,
      "score": 44.4,
      "analysis": "38/49",
      "ingest": "4/6",
      "costPerTask": 1.18,
      "costPerSuite": 65,
      "costPerPass": 1.54,
      "latency": 113,
      "tools": 27.2
    },
    {
      "rank": 3,
      "model": "Claude Opus 4.6",
      "provider": "Bedrock (Anthropic)",
      "tier": "High",
      "passed": 41,
      "total": 55,
      "passRate": 74.5,
      "score": 43.5,
      "analysis": "37/49",
      "ingest": "4/6",
      "costPerTask": 2.27,
      "costPerSuite": 125,
      "costPerPass": 3.04,
      "latency": 110,
      "tools": 23.1
    },
    {
      "rank": 4,
      "model": "GPT-5.6 Terra",
      "provider": "Azure Foundry (OpenAI)",
      "tier": "Med",
      "passed": 40,
      "total": 55,
      "passRate": 72.7,
      "score": 42.8,
      "analysis": "36/49",
      "ingest": "4/6",
      "costPerTask": 1,
      "costPerSuite": 55,
      "costPerPass": 1.37,
      "latency": 74,
      "tools": 23.9
    },
    {
      "rank": 5,
      "model": "DeepSeek V4.1 Flash",
      "provider": "Fireworks (direct)",
      "tier": "Low",
      "passed": 38,
      "total": 55,
      "passRate": 69.1,
      "score": 39.7,
      "analysis": "38/49",
      "ingest": "0/6",
      "costPerTask": 0.18,
      "costPerSuite": 10,
      "costPerPass": 0.26,
      "latency": 209,
      "tools": 37.3
    },
    {
      "rank": 6,
      "model": "GPT-5.6 Luna",
      "provider": "Azure Foundry (OpenAI)",
      "tier": "Low",
      "passed": 37,
      "total": 55,
      "passRate": 67.3,
      "score": 40.9,
      "analysis": "35/49",
      "ingest": "2/6",
      "costPerTask": 0.08,
      "costPerSuite": 4,
      "costPerPass": 0.12,
      "latency": 291,
      "tools": 22.5
    },
    {
      "rank": 7,
      "model": "Claude Opus 4.8",
      "provider": "Bedrock (Anthropic)",
      "tier": "High",
      "passed": 37,
      "total": 55,
      "passRate": 67.3,
      "score": 39.8,
      "analysis": "34/49",
      "ingest": "3/6",
      "costPerTask": 1.52,
      "costPerSuite": 84,
      "costPerPass": 2.26,
      "latency": 68,
      "tools": 22
    },
    {
      "rank": 8,
      "model": "Kimi K3 (FW)",
      "provider": "Azure Foundry (Fireworks)",
      "tier": "Med",
      "passed": 37,
      "total": 55,
      "passRate": 67.3,
      "score": 39.6,
      "analysis": "33/49",
      "ingest": "4/6",
      "costPerTask": 0.31,
      "costPerSuite": 17,
      "costPerPass": 0.46,
      "latency": 118,
      "tools": 23.6
    },
    {
      "rank": 9,
      "model": "Claude Sonnet 5",
      "provider": "Bedrock (Anthropic)",
      "tier": "Med",
      "passed": 36,
      "total": 55,
      "passRate": 65.5,
      "score": 39.6,
      "analysis": "33/49",
      "ingest": "3/6",
      "costPerTask": 0.86,
      "costPerSuite": 48,
      "costPerPass": 1.32,
      "latency": 69,
      "tools": 22.7
    },
    {
      "rank": 10,
      "model": "DeepSeek V4 Pro",
      "provider": "Azure Foundry (DeepSeek)",
      "tier": "High",
      "passed": 36,
      "total": 55,
      "passRate": 65.5,
      "score": 39.6,
      "analysis": "33/49",
      "ingest": "3/6",
      "costPerTask": 0.55,
      "costPerSuite": 30,
      "costPerPass": 0.83,
      "latency": 109,
      "tools": 29.8
    },
    {
      "rank": 11,
      "model": "Claude Sonnet 4.6",
      "provider": "Bedrock (Anthropic)",
      "tier": "Med",
      "passed": 36,
      "total": 55,
      "passRate": 65.5,
      "score": 38.9,
      "analysis": "33/49",
      "ingest": "3/6",
      "costPerTask": 0.99,
      "costPerSuite": 54,
      "costPerPass": 1.51,
      "latency": 83,
      "tools": 23.8
    },
    {
      "rank": 12,
      "model": "Claude Opus 5",
      "provider": "Bedrock (Anthropic)",
      "tier": "High",
      "passed": 35,
      "total": 55,
      "passRate": 63.6,
      "score": 39.4,
      "analysis": "32/49",
      "ingest": "3/6",
      "costPerTask": 1.64,
      "costPerSuite": 90,
      "costPerPass": 2.58,
      "latency": 76,
      "tools": 23.7
    },
    {
      "rank": 13,
      "model": "DeepSeek V4 Flash",
      "provider": "Azure Foundry (DeepSeek)",
      "tier": "Low",
      "passed": 35,
      "total": 55,
      "passRate": 63.6,
      "score": 37.9,
      "analysis": "32/49",
      "ingest": "3/6",
      "costPerTask": 0.09,
      "costPerSuite": 5,
      "costPerPass": 0.14,
      "latency": 155,
      "tools": 26.6
    },
    {
      "rank": 14,
      "model": "GLM 5.3 (FW)",
      "provider": "Azure Foundry (Fireworks)",
      "tier": "Med",
      "passed": 35,
      "total": 55,
      "passRate": 63.6,
      "score": 37.1,
      "analysis": "34/49",
      "ingest": "1/6",
      "costPerTask": 0.3,
      "costPerSuite": 17,
      "costPerPass": 0.47,
      "latency": 342,
      "tools": 30
    },
    {
      "rank": 15,
      "model": "GPT-5.4",
      "provider": "Azure Foundry (OpenAI)",
      "tier": "Med",
      "passed": 29,
      "total": 55,
      "passRate": 52.7,
      "score": 31.6,
      "analysis": "28/49",
      "ingest": "1/6",
      "costPerTask": 0.71,
      "costPerSuite": 39,
      "costPerPass": 1.35,
      "latency": 39,
      "tools": 18.2
    },
    {
      "rank": 16,
      "model": "Claude Haiku 4.5",
      "provider": "Bedrock (Anthropic)",
      "tier": "Low",
      "passed": 25,
      "total": 55,
      "passRate": 45.5,
      "score": 29.1,
      "analysis": "25/49",
      "ingest": "0/6",
      "costPerTask": 0.26,
      "costPerSuite": 14,
      "costPerPass": 0.57,
      "latency": 49,
      "tools": 18.7
    },
    {
      "rank": 17,
      "model": "Cohere Command A+",
      "provider": "Azure Foundry (Cohere)",
      "tier": "Med",
      "passed": 9,
      "total": 55,
      "passRate": 16.4,
      "score": 11.7,
      "analysis": "9/49",
      "ingest": "0/6",
      "costPerTask": 1.31,
      "costPerSuite": 72,
      "costPerPass": 7.98,
      "latency": 150,
      "tools": 37.1
    }
  ],
  "by_category": [
    {
      "category": "Ingest Harness",
      "model": "GPT-5.6 Sol",
      "provider": "Azure Foundry (OpenAI)",
      "tier": "High",
      "passed": 5,
      "total": 6,
      "passRate": 83.3,
      "score": 5.9,
      "costPerTask": 11.61,
      "latency": 364,
      "toolCalls": 79.7,
      "note": "7 samples"
    },
    {
      "category": "Ingest Harness",
      "model": "GPT-5.6 Terra",
      "provider": "Azure Foundry (OpenAI)",
      "tier": "Med",
      "passed": 4,
      "total": 6,
      "passRate": 66.7,
      "score": 4.73,
      "costPerTask": 4.06,
      "latency": 286,
      "toolCalls": 67.5,
      "note": "12 samples"
    },
    {
      "category": "Ingest Harness",
      "model": "Kimi K3 (FW)",
      "provider": "Azure Foundry (Fireworks)",
      "tier": "Med",
      "passed": 4,
      "total": 6,
      "passRate": 66.7,
      "score": 4.7,
      "costPerTask": 0.93,
      "latency": 272,
      "toolCalls": 48.5,
      "note": "6 samples"
    },
    {
      "category": "Ingest Harness",
      "model": "Claude Opus 4.6",
      "provider": "Bedrock (Anthropic)",
      "tier": "High",
      "passed": 4,
      "total": 6,
      "passRate": 66.7,
      "score": 4.65,
      "costPerTask": 9.97,
      "latency": 299,
      "toolCalls": 62.4,
      "note": "7 samples"
    },
    {
      "category": "Ingest Harness",
      "model": "GPT-5.5",
      "provider": "Azure Foundry (OpenAI)",
      "tier": "High",
      "passed": 4,
      "total": 6,
      "passRate": 66.7,
      "score": 4.2,
      "costPerTask": 4.16,
      "latency": 424,
      "toolCalls": 67.3,
      "note": "6 samples"
    },
    {
      "category": "Ingest Harness",
      "model": "Claude Opus 5",
      "provider": "Bedrock (Anthropic)",
      "tier": "High",
      "passed": 3,
      "total": 6,
      "passRate": 50,
      "score": 4.65,
      "costPerTask": 5.47,
      "latency": 200,
      "toolCalls": 48.2,
      "note": "6 samples"
    },
    {
      "category": "Ingest Harness",
      "model": "Claude Sonnet 5",
      "provider": "Bedrock (Anthropic)",
      "tier": "Med",
      "passed": 3,
      "total": 6,
      "passRate": 50,
      "score": 4.65,
      "costPerTask": 4.19,
      "latency": 249,
      "toolCalls": 51.7,
      "note": "6 samples"
    },
    {
      "category": "Ingest Harness",
      "model": "Claude Sonnet 4.6",
      "provider": "Bedrock (Anthropic)",
      "tier": "Med",
      "passed": 3,
      "total": 6,
      "passRate": 50,
      "score": 4.5,
      "costPerTask": 3.75,
      "latency": 257,
      "toolCalls": 51.8,
      "note": "6 samples"
    },
    {
      "category": "Ingest Harness",
      "model": "Claude Opus 4.8",
      "provider": "Bedrock (Anthropic)",
      "tier": "High",
      "passed": 3,
      "total": 6,
      "passRate": 50,
      "score": 3.9,
      "costPerTask": 5.11,
      "latency": 198,
      "toolCalls": 46,
      "note": "6 samples"
    },
    {
      "category": "Ingest Harness",
      "model": "DeepSeek V4 Pro",
      "provider": "Azure Foundry (DeepSeek)",
      "tier": "High",
      "passed": 3,
      "total": 6,
      "passRate": 50,
      "score": 3.85,
      "costPerTask": 1.62,
      "latency": 217,
      "toolCalls": 53.3,
      "note": "6 samples"
    },
    {
      "category": "Ingest Harness",
      "model": "DeepSeek V4 Flash",
      "provider": "Azure Foundry (DeepSeek)",
      "tier": "Low",
      "passed": 3,
      "total": 6,
      "passRate": 50,
      "score": 3.15,
      "costPerTask": 0.3,
      "latency": 302,
      "toolCalls": 52.3,
      "note": "6 samples"
    },
    {
      "category": "Ingest Harness",
      "model": "GPT-5.6 Luna",
      "provider": "Azure Foundry (OpenAI)",
      "tier": "Low",
      "passed": 2,
      "total": 6,
      "passRate": 33.3,
      "score": 3.17,
      "costPerTask": 0.22,
      "latency": 873,
      "toolCalls": 37.6,
      "note": "9 samples"
    },
    {
      "category": "Ingest Harness",
      "model": "GPT-5.4",
      "provider": "Azure Foundry (OpenAI)",
      "tier": "Med",
      "passed": 1,
      "total": 6,
      "passRate": 16.7,
      "score": 1.52,
      "costPerTask": 1.34,
      "latency": 91,
      "toolCalls": 27.3,
      "note": "6 samples"
    },
    {
      "category": "Ingest Harness",
      "model": "GLM 5.3 (FW)",
      "provider": "Azure Foundry (Fireworks)",
      "tier": "Med",
      "passed": 1,
      "total": 6,
      "passRate": 16.7,
      "score": 1.5,
      "costPerTask": 0.54,
      "latency": 994,
      "toolCalls": 34.7,
      "note": "6 samples"
    },
    {
      "category": "Ingest Harness",
      "model": "Claude Haiku 4.5",
      "provider": "Bedrock (Anthropic)",
      "tier": "Low",
      "passed": 0,
      "total": 6,
      "passRate": 0,
      "score": 2.25,
      "costPerTask": 1.14,
      "latency": 138,
      "toolCalls": 54.4,
      "note": "7 samples"
    },
    {
      "category": "Ingest Harness",
      "model": "Cohere Command A+",
      "provider": "Azure Foundry (Cohere)",
      "tier": "Med",
      "passed": 0,
      "total": 6,
      "passRate": 0,
      "score": 1.05,
      "costPerTask": 1.53,
      "latency": 155,
      "toolCalls": 35.7,
      "note": "6 samples"
    },
    {
      "category": "Ingest Harness",
      "model": "DeepSeek V4.1 Flash",
      "provider": "Fireworks (direct)",
      "tier": "Low",
      "passed": 0,
      "total": 6,
      "passRate": 0,
      "score": 0.5,
      "costPerTask": 0.25,
      "latency": 323,
      "toolCalls": 30.7,
      "note": "6 samples"
    },
    {
      "category": "Lookups & Metrics",
      "model": "GPT-5.6 Sol",
      "provider": "Azure Foundry (OpenAI)",
      "tier": "High",
      "passed": 12,
      "total": 12,
      "passRate": 100,
      "score": 12,
      "costPerTask": 0.44,
      "latency": 28,
      "toolCalls": 7.2,
      "note": "37/49"
    },
    {
      "category": "Lookups & Metrics",
      "model": "GPT-5.6 Terra",
      "provider": "Azure Foundry (OpenAI)",
      "tier": "Med",
      "passed": 12,
      "total": 12,
      "passRate": 100,
      "score": 12,
      "costPerTask": 0.19,
      "latency": 17,
      "toolCalls": 7.4,
      "note": "36/49"
    },
    {
      "category": "Lookups & Metrics",
      "model": "DeepSeek V4 Pro",
      "provider": "Azure Foundry (DeepSeek)",
      "tier": "High",
      "passed": 12,
      "total": 12,
      "passRate": 100,
      "score": 12,
      "costPerTask": 0.12,
      "latency": 38,
      "toolCalls": 10.8,
      "note": "33/49"
    },
    {
      "category": "Lookups & Metrics",
      "model": "GPT-5.5",
      "provider": "Azure Foundry (OpenAI)",
      "tier": "High",
      "passed": 12,
      "total": 12,
      "passRate": 100,
      "score": 12,
      "costPerTask": 0.23,
      "latency": 23,
      "toolCalls": 7.8,
      "note": "38/49"
    },
    {
      "category": "Lookups & Metrics",
      "model": "Kimi K3 (FW)",
      "provider": "Azure Foundry (Fireworks)",
      "tier": "Med",
      "passed": 12,
      "total": 12,
      "passRate": 100,
      "score": 12,
      "costPerTask": 0.06,
      "latency": 57,
      "toolCalls": 8.1,
      "note": "33/49"
    },
    {
      "category": "Lookups & Metrics",
      "model": "GLM 5.3 (FW)",
      "provider": "Azure Foundry (Fireworks)",
      "tier": "Med",
      "passed": 12,
      "total": 12,
      "passRate": 100,
      "score": 12,
      "costPerTask": 0.07,
      "latency": 56,
      "toolCalls": 10.8,
      "note": "34/49"
    },
    {
      "category": "Lookups & Metrics",
      "model": "DeepSeek V4.1 Flash",
      "provider": "Fireworks (direct)",
      "tier": "Low",
      "passed": 12,
      "total": 12,
      "passRate": 100,
      "score": 11.99,
      "costPerTask": 0.04,
      "latency": 36,
      "toolCalls": 9.9,
      "note": "38/49"
    },
    {
      "category": "Lookups & Metrics",
      "model": "GPT-5.6 Luna",
      "provider": "Azure Foundry (OpenAI)",
      "tier": "Low",
      "passed": 11,
      "total": 12,
      "passRate": 91.7,
      "score": 11.41,
      "costPerTask": 0.03,
      "latency": 98,
      "toolCalls": 9.9,
      "note": "35/49"
    },
    {
      "category": "Lookups & Metrics",
      "model": "GPT-5.4",
      "provider": "Azure Foundry (OpenAI)",
      "tier": "Med",
      "passed": 11,
      "total": 12,
      "passRate": 91.7,
      "score": 11.1,
      "costPerTask": 0.19,
      "latency": 15,
      "toolCalls": 8.9,
      "note": "28/49"
    },
    {
      "category": "Lookups & Metrics",
      "model": "Claude Opus 4.6",
      "provider": "Bedrock (Anthropic)",
      "tier": "High",
      "passed": 11,
      "total": 12,
      "passRate": 91.7,
      "score": 11,
      "costPerTask": 0.33,
      "latency": 32,
      "toolCalls": 7.8,
      "note": "37/49"
    },
    {
      "category": "Lookups & Metrics",
      "model": "DeepSeek V4 Flash",
      "provider": "Azure Foundry (DeepSeek)",
      "tier": "Low",
      "passed": 10,
      "total": 12,
      "passRate": 83.3,
      "score": 10.43,
      "costPerTask": 0.02,
      "latency": 36,
      "toolCalls": 10.2,
      "note": "32/49"
    },
    {
      "category": "Lookups & Metrics",
      "model": "Claude Opus 4.8",
      "provider": "Bedrock (Anthropic)",
      "tier": "High",
      "passed": 10,
      "total": 12,
      "passRate": 83.3,
      "score": 10.09,
      "costPerTask": 0.25,
      "latency": 23,
      "toolCalls": 7.8,
      "note": "34/49"
    },
    {
      "category": "Lookups & Metrics",
      "model": "Claude Opus 5",
      "provider": "Bedrock (Anthropic)",
      "tier": "High",
      "passed": 10,
      "total": 12,
      "passRate": 83.3,
      "score": 10.07,
      "costPerTask": 0.27,
      "latency": 26,
      "toolCalls": 8.2,
      "note": "32/49"
    },
    {
      "category": "Lookups & Metrics",
      "model": "Claude Sonnet 4.6",
      "provider": "Bedrock (Anthropic)",
      "tier": "Med",
      "passed": 10,
      "total": 12,
      "passRate": 83.3,
      "score": 10.06,
      "costPerTask": 0.16,
      "latency": 24,
      "toolCalls": 7.5,
      "note": "33/49"
    },
    {
      "category": "Lookups & Metrics",
      "model": "Claude Haiku 4.5",
      "provider": "Bedrock (Anthropic)",
      "tier": "Low",
      "passed": 10,
      "total": 12,
      "passRate": 83.3,
      "score": 9.8,
      "costPerTask": 0.06,
      "latency": 18,
      "toolCalls": 7.3,
      "note": "25/49"
    },
    {
      "category": "Lookups & Metrics",
      "model": "Claude Sonnet 5",
      "provider": "Bedrock (Anthropic)",
      "tier": "Med",
      "passed": 9,
      "total": 12,
      "passRate": 75,
      "score": 9.14,
      "costPerTask": 0.12,
      "latency": 23,
      "toolCalls": 8.3,
      "note": "33/49"
    },
    {
      "category": "Lookups & Metrics",
      "model": "Cohere Command A+",
      "provider": "Azure Foundry (Cohere)",
      "tier": "Med",
      "passed": 5,
      "total": 12,
      "passRate": 41.7,
      "score": 5.01,
      "costPerTask": 0.7,
      "latency": 85,
      "toolCalls": 27.9,
      "note": "9/49"
    },
    {
      "category": "Statements",
      "model": "DeepSeek V4.1 Flash",
      "provider": "Fireworks (direct)",
      "tier": "Low",
      "passed": 5,
      "total": 7,
      "passRate": 71.4,
      "score": 5.44,
      "costPerTask": 0.2,
      "latency": 290,
      "toolCalls": 58,
      "note": "38/49"
    },
    {
      "category": "Statements",
      "model": "GPT-5.6 Sol",
      "provider": "Azure Foundry (OpenAI)",
      "tier": "High",
      "passed": 5,
      "total": 7,
      "passRate": 71.4,
      "score": 5.25,
      "costPerTask": 1.07,
      "latency": 58,
      "toolCalls": 30.7,
      "note": "37/49"
    },
    {
      "category": "Statements",
      "model": "GPT-5.5",
      "provider": "Azure Foundry (OpenAI)",
      "tier": "High",
      "passed": 4,
      "total": 7,
      "passRate": 57.1,
      "score": 4.67,
      "costPerTask": 0.56,
      "latency": 71,
      "toolCalls": 24.1,
      "note": "38/49"
    },
    {
      "category": "Statements",
      "model": "DeepSeek V4 Flash",
      "provider": "Azure Foundry (DeepSeek)",
      "tier": "Low",
      "passed": 4,
      "total": 7,
      "passRate": 57.1,
      "score": 4.65,
      "costPerTask": 0.07,
      "latency": 111,
      "toolCalls": 25.7,
      "note": "32/49"
    },
    {
      "category": "Statements",
      "model": "Claude Opus 4.6",
      "provider": "Bedrock (Anthropic)",
      "tier": "High",
      "passed": 4,
      "total": 7,
      "passRate": 57.1,
      "score": 4.61,
      "costPerTask": 1.03,
      "latency": 94,
      "toolCalls": 22.7,
      "note": "37/49"
    },
    {
      "category": "Statements",
      "model": "GPT-5.6 Luna",
      "provider": "Azure Foundry (OpenAI)",
      "tier": "Low",
      "passed": 4,
      "total": 7,
      "passRate": 57.1,
      "score": 4.32,
      "costPerTask": 0.04,
      "latency": 139,
      "toolCalls": 25.9,
      "note": "35/49"
    },
    {
      "category": "Statements",
      "model": "GLM 5.3 (FW)",
      "provider": "Azure Foundry (Fireworks)",
      "tier": "Med",
      "passed": 4,
      "total": 7,
      "passRate": 57.1,
      "score": 4.29,
      "costPerTask": 0.19,
      "latency": 245,
      "toolCalls": 33.1,
      "note": "34/49"
    },
    {
      "category": "Statements",
      "model": "DeepSeek V4 Pro",
      "provider": "Azure Foundry (DeepSeek)",
      "tier": "High",
      "passed": 3,
      "total": 7,
      "passRate": 42.9,
      "score": 3.81,
      "costPerTask": 0.47,
      "latency": 148,
      "toolCalls": 51.6,
      "note": "33/49"
    },
    {
      "category": "Statements",
      "model": "Kimi K3 (FW)",
      "provider": "Azure Foundry (Fireworks)",
      "tier": "Med",
      "passed": 3,
      "total": 7,
      "passRate": 42.9,
      "score": 3.61,
      "costPerTask": 0.14,
      "latency": 121,
      "toolCalls": 19.6,
      "note": "33/49"
    },
    {
      "category": "Statements",
      "model": "GPT-5.6 Terra",
      "provider": "Azure Foundry (OpenAI)",
      "tier": "Med",
      "passed": 3,
      "total": 7,
      "passRate": 42.9,
      "score": 3.43,
      "costPerTask": 0.41,
      "latency": 47,
      "toolCalls": 18.3,
      "note": "36/49"
    },
    {
      "category": "Statements",
      "model": "Claude Opus 4.8",
      "provider": "Bedrock (Anthropic)",
      "tier": "High",
      "passed": 3,
      "total": 7,
      "passRate": 42.9,
      "score": 3.35,
      "costPerTask": 0.88,
      "latency": 74,
      "toolCalls": 29.6,
      "note": "34/49"
    },
    {
      "category": "Statements",
      "model": "Claude Sonnet 4.6",
      "provider": "Bedrock (Anthropic)",
      "tier": "Med",
      "passed": 3,
      "total": 7,
      "passRate": 42.9,
      "score": 3.04,
      "costPerTask": 0.53,
      "latency": 72,
      "toolCalls": 26.8,
      "note": "33/49"
    },
    {
      "category": "Statements",
      "model": "Claude Opus 5",
      "provider": "Bedrock (Anthropic)",
      "tier": "High",
      "passed": 2,
      "total": 7,
      "passRate": 28.6,
      "score": 2.97,
      "costPerTask": 0.9,
      "latency": 75,
      "toolCalls": 29.3,
      "note": "32/49"
    },
    {
      "category": "Statements",
      "model": "GPT-5.4",
      "provider": "Azure Foundry (OpenAI)",
      "tier": "Med",
      "passed": 2,
      "total": 7,
      "passRate": 28.6,
      "score": 2.77,
      "costPerTask": 0.4,
      "latency": 31,
      "toolCalls": 17.4,
      "note": "28/49"
    },
    {
      "category": "Statements",
      "model": "Claude Haiku 4.5",
      "provider": "Bedrock (Anthropic)",
      "tier": "Low",
      "passed": 2,
      "total": 7,
      "passRate": 28.6,
      "score": 2.51,
      "costPerTask": 0.16,
      "latency": 38,
      "toolCalls": 18,
      "note": "25/49"
    },
    {
      "category": "Statements",
      "model": "Claude Sonnet 5",
      "provider": "Bedrock (Anthropic)",
      "tier": "Med",
      "passed": 1,
      "total": 7,
      "passRate": 14.3,
      "score": 1.81,
      "costPerTask": 0.39,
      "latency": 61,
      "toolCalls": 26.7,
      "note": "33/49"
    },
    {
      "category": "Statements",
      "model": "Cohere Command A+",
      "provider": "Azure Foundry (Cohere)",
      "tier": "Med",
      "passed": 0,
      "total": 7,
      "passRate": 0,
      "score": 0.22,
      "costPerTask": 1.62,
      "latency": 218,
      "toolCalls": 52.3,
      "note": "9/49"
    },
    {
      "category": "Error Recovery",
      "model": "Claude Sonnet 5",
      "provider": "Bedrock (Anthropic)",
      "tier": "Med",
      "passed": 6,
      "total": 7,
      "passRate": 85.7,
      "score": 6.14,
      "costPerTask": 0.54,
      "latency": 75,
      "toolCalls": 28.7,
      "note": "33/49"
    },
    {
      "category": "Error Recovery",
      "model": "Claude Opus 4.8",
      "provider": "Bedrock (Anthropic)",
      "tier": "High",
      "passed": 6,
      "total": 7,
      "passRate": 85.7,
      "score": 6.1,
      "costPerTask": 1.2,
      "latency": 72,
      "toolCalls": 25,
      "note": "34/49"
    },
    {
      "category": "Error Recovery",
      "model": "GPT-5.5",
      "provider": "Azure Foundry (OpenAI)",
      "tier": "High",
      "passed": 6,
      "total": 7,
      "passRate": 85.7,
      "score": 6,
      "costPerTask": 1.48,
      "latency": 152,
      "toolCalls": 46,
      "note": "38/49"
    },
    {
      "category": "Error Recovery",
      "model": "Claude Opus 5",
      "provider": "Bedrock (Anthropic)",
      "tier": "High",
      "passed": 6,
      "total": 7,
      "passRate": 85.7,
      "score": 6,
      "costPerTask": 1.24,
      "latency": 107,
      "toolCalls": 35,
      "note": "32/49"
    },
    {
      "category": "Error Recovery",
      "model": "Claude Opus 4.6",
      "provider": "Bedrock (Anthropic)",
      "tier": "High",
      "passed": 6,
      "total": 7,
      "passRate": 85.7,
      "score": 5.85,
      "costPerTask": 1.47,
      "latency": 97,
      "toolCalls": 22.4,
      "note": "37/49"
    },
    {
      "category": "Error Recovery",
      "model": "GPT-5.6 Terra",
      "provider": "Azure Foundry (OpenAI)",
      "tier": "Med",
      "passed": 5,
      "total": 7,
      "passRate": 71.4,
      "score": 5.15,
      "costPerTask": 0.77,
      "latency": 78,
      "toolCalls": 33.6,
      "note": "36/49"
    },
    {
      "category": "Error Recovery",
      "model": "DeepSeek V4 Pro",
      "provider": "Azure Foundry (DeepSeek)",
      "tier": "High",
      "passed": 5,
      "total": 7,
      "passRate": 71.4,
      "score": 5,
      "costPerTask": 0.56,
      "latency": 151,
      "toolCalls": 33.7,
      "note": "33/49"
    },
    {
      "category": "Error Recovery",
      "model": "Claude Sonnet 4.6",
      "provider": "Bedrock (Anthropic)",
      "tier": "Med",
      "passed": 5,
      "total": 7,
      "passRate": 71.4,
      "score": 4.79,
      "costPerTask": 0.71,
      "latency": 103,
      "toolCalls": 32.3,
      "note": "33/49"
    },
    {
      "category": "Error Recovery",
      "model": "GPT-5.6 Luna",
      "provider": "Azure Foundry (OpenAI)",
      "tier": "Low",
      "passed": 4,
      "total": 7,
      "passRate": 57.1,
      "score": 4.43,
      "costPerTask": 0.07,
      "latency": 223,
      "toolCalls": 29.7,
      "note": "35/49"
    },
    {
      "category": "Error Recovery",
      "model": "DeepSeek V4 Flash",
      "provider": "Azure Foundry (DeepSeek)",
      "tier": "Low",
      "passed": 4,
      "total": 7,
      "passRate": 57.1,
      "score": 4.15,
      "costPerTask": 0.08,
      "latency": 322,
      "toolCalls": 30.7,
      "note": "32/49"
    },
    {
      "category": "Error Recovery",
      "model": "GLM 5.3 (FW)",
      "provider": "Azure Foundry (Fireworks)",
      "tier": "Med",
      "passed": 4,
      "total": 7,
      "passRate": 57.1,
      "score": 4,
      "costPerTask": 0.47,
      "latency": 526,
      "toolCalls": 49.6,
      "note": "34/49"
    },
    {
      "category": "Error Recovery",
      "model": "DeepSeek V4.1 Flash",
      "provider": "Fireworks (direct)",
      "tier": "Low",
      "passed": 4,
      "total": 7,
      "passRate": 57.1,
      "score": 4,
      "costPerTask": 0.22,
      "latency": 398,
      "toolCalls": 53.9,
      "note": "38/49"
    },
    {
      "category": "Error Recovery",
      "model": "GPT-5.6 Sol",
      "provider": "Azure Foundry (OpenAI)",
      "tier": "High",
      "passed": 4,
      "total": 7,
      "passRate": 57.1,
      "score": 3.97,
      "costPerTask": 1.84,
      "latency": 78,
      "toolCalls": 28.6,
      "note": "37/49"
    },
    {
      "category": "Error Recovery",
      "model": "Kimi K3 (FW)",
      "provider": "Azure Foundry (Fireworks)",
      "tier": "Med",
      "passed": 3,
      "total": 7,
      "passRate": 42.9,
      "score": 3.05,
      "costPerTask": 0.31,
      "latency": 142,
      "toolCalls": 34.3,
      "note": "33/49"
    },
    {
      "category": "Error Recovery",
      "model": "GPT-5.4",
      "provider": "Azure Foundry (OpenAI)",
      "tier": "Med",
      "passed": 2,
      "total": 7,
      "passRate": 28.6,
      "score": 2.15,
      "costPerTask": 0.68,
      "latency": 54,
      "toolCalls": 25,
      "note": "28/49"
    },
    {
      "category": "Error Recovery",
      "model": "Claude Haiku 4.5",
      "provider": "Bedrock (Anthropic)",
      "tier": "Low",
      "passed": 2,
      "total": 7,
      "passRate": 28.6,
      "score": 1.8,
      "costPerTask": 0.13,
      "latency": 34,
      "toolCalls": 14.8,
      "note": "25/49"
    },
    {
      "category": "Error Recovery",
      "model": "Cohere Command A+",
      "provider": "Azure Foundry (Cohere)",
      "tier": "Med",
      "passed": 0,
      "total": 7,
      "passRate": 0,
      "score": 0,
      "costPerTask": 1.36,
      "latency": 147,
      "toolCalls": 44.4,
      "note": "9/49"
    },
    {
      "category": "Boards & Widgets",
      "model": "GPT-5.6 Terra",
      "provider": "Azure Foundry (OpenAI)",
      "tier": "Med",
      "passed": 8,
      "total": 8,
      "passRate": 100,
      "score": 7.96,
      "costPerTask": 1.02,
      "latency": 60,
      "toolCalls": 29.6,
      "note": "36/49"
    },
    {
      "category": "Boards & Widgets",
      "model": "GPT-5.6 Sol",
      "provider": "Azure Foundry (OpenAI)",
      "tier": "High",
      "passed": 8,
      "total": 8,
      "passRate": 100,
      "score": 7.92,
      "costPerTask": 3.3,
      "latency": 99,
      "toolCalls": 39,
      "note": "37/49"
    },
    {
      "category": "Boards & Widgets",
      "model": "Claude Sonnet 4.6",
      "provider": "Bedrock (Anthropic)",
      "tier": "Med",
      "passed": 8,
      "total": 8,
      "passRate": 100,
      "score": 7.92,
      "costPerTask": 1.08,
      "latency": 79,
      "toolCalls": 28.7,
      "note": "33/49"
    },
    {
      "category": "Boards & Widgets",
      "model": "Claude Sonnet 5",
      "provider": "Bedrock (Anthropic)",
      "tier": "Med",
      "passed": 8,
      "total": 8,
      "passRate": 100,
      "score": 7.91,
      "costPerTask": 0.77,
      "latency": 65,
      "toolCalls": 29.9,
      "note": "33/49"
    },
    {
      "category": "Boards & Widgets",
      "model": "GPT-5.5",
      "provider": "Azure Foundry (OpenAI)",
      "tier": "High",
      "passed": 8,
      "total": 8,
      "passRate": 100,
      "score": 7.88,
      "costPerTask": 1.3,
      "latency": 109,
      "toolCalls": 32.8,
      "note": "38/49"
    },
    {
      "category": "Boards & Widgets",
      "model": "Claude Opus 4.6",
      "provider": "Bedrock (Anthropic)",
      "tier": "High",
      "passed": 8,
      "total": 8,
      "passRate": 100,
      "score": 7.86,
      "costPerTask": 2.43,
      "latency": 122,
      "toolCalls": 31.8,
      "note": "37/49"
    },
    {
      "category": "Boards & Widgets",
      "model": "DeepSeek V4.1 Flash",
      "provider": "Fireworks (direct)",
      "tier": "Low",
      "passed": 8,
      "total": 8,
      "passRate": 100,
      "score": 7.84,
      "costPerTask": 0.26,
      "latency": 214,
      "toolCalls": 52.1,
      "note": "38/49"
    },
    {
      "category": "Boards & Widgets",
      "model": "Claude Opus 4.8",
      "provider": "Bedrock (Anthropic)",
      "tier": "High",
      "passed": 7,
      "total": 8,
      "passRate": 87.5,
      "score": 7.08,
      "costPerTask": 1.86,
      "latency": 75,
      "toolCalls": 28.5,
      "note": "34/49"
    },
    {
      "category": "Boards & Widgets",
      "model": "GPT-5.6 Luna",
      "provider": "Azure Foundry (OpenAI)",
      "tier": "Low",
      "passed": 7,
      "total": 8,
      "passRate": 87.5,
      "score": 7.07,
      "costPerTask": 0.09,
      "latency": 202,
      "toolCalls": 25.9,
      "note": "35/49"
    },
    {
      "category": "Boards & Widgets",
      "model": "Kimi K3 (FW)",
      "provider": "Azure Foundry (Fireworks)",
      "tier": "Med",
      "passed": 7,
      "total": 8,
      "passRate": 87.5,
      "score": 6.93,
      "costPerTask": 0.43,
      "latency": 131,
      "toolCalls": 32.9,
      "note": "33/49"
    },
    {
      "category": "Boards & Widgets",
      "model": "Claude Opus 5",
      "provider": "Bedrock (Anthropic)",
      "tier": "High",
      "passed": 7,
      "total": 8,
      "passRate": 87.5,
      "score": 6.9,
      "costPerTask": 1.88,
      "latency": 79,
      "toolCalls": 29.5,
      "note": "32/49"
    },
    {
      "category": "Boards & Widgets",
      "model": "DeepSeek V4 Flash",
      "provider": "Azure Foundry (DeepSeek)",
      "tier": "Low",
      "passed": 6,
      "total": 8,
      "passRate": 75,
      "score": 6.33,
      "costPerTask": 0.1,
      "latency": 146,
      "toolCalls": 39.4,
      "note": "32/49"
    },
    {
      "category": "Boards & Widgets",
      "model": "DeepSeek V4 Pro",
      "provider": "Azure Foundry (DeepSeek)",
      "tier": "High",
      "passed": 6,
      "total": 8,
      "passRate": 75,
      "score": 6.08,
      "costPerTask": 0.67,
      "latency": 112,
      "toolCalls": 40.2,
      "note": "33/49"
    },
    {
      "category": "Boards & Widgets",
      "model": "GLM 5.3 (FW)",
      "provider": "Azure Foundry (Fireworks)",
      "tier": "Med",
      "passed": 6,
      "total": 8,
      "passRate": 75,
      "score": 6,
      "costPerTask": 0.4,
      "latency": 423,
      "toolCalls": 42.9,
      "note": "34/49"
    },
    {
      "category": "Boards & Widgets",
      "model": "GPT-5.4",
      "provider": "Azure Foundry (OpenAI)",
      "tier": "Med",
      "passed": 5,
      "total": 8,
      "passRate": 62.5,
      "score": 5.06,
      "costPerTask": 0.97,
      "latency": 48,
      "toolCalls": 24.8,
      "note": "28/49"
    },
    {
      "category": "Boards & Widgets",
      "model": "Claude Haiku 4.5",
      "provider": "Bedrock (Anthropic)",
      "tier": "Low",
      "passed": 5,
      "total": 8,
      "passRate": 62.5,
      "score": 4.87,
      "costPerTask": 0.3,
      "latency": 44,
      "toolCalls": 24.2,
      "note": "25/49"
    },
    {
      "category": "Boards & Widgets",
      "model": "Cohere Command A+",
      "provider": "Azure Foundry (Cohere)",
      "tier": "Med",
      "passed": 3,
      "total": 8,
      "passRate": 37.5,
      "score": 3.01,
      "costPerTask": 1,
      "latency": 218,
      "toolCalls": 30.2,
      "note": "9/49"
    },
    {
      "category": "Charts",
      "model": "GPT-5.6 Luna",
      "provider": "Azure Foundry (OpenAI)",
      "tier": "Low",
      "passed": 3,
      "total": 4,
      "passRate": 75,
      "score": 3.17,
      "costPerTask": 0.09,
      "latency": 228,
      "toolCalls": 29.2,
      "note": "35/49"
    },
    {
      "category": "Charts",
      "model": "Claude Opus 4.6",
      "provider": "Bedrock (Anthropic)",
      "tier": "High",
      "passed": 3,
      "total": 4,
      "passRate": 75,
      "score": 3.07,
      "costPerTask": 2.1,
      "latency": 91,
      "toolCalls": 20.8,
      "note": "37/49"
    },
    {
      "category": "Charts",
      "model": "Claude Sonnet 4.6",
      "provider": "Bedrock (Anthropic)",
      "tier": "Med",
      "passed": 3,
      "total": 4,
      "passRate": 75,
      "score": 3.05,
      "costPerTask": 1.2,
      "latency": 66,
      "toolCalls": 24.7,
      "note": "33/49"
    },
    {
      "category": "Charts",
      "model": "Claude Opus 5",
      "provider": "Bedrock (Anthropic)",
      "tier": "High",
      "passed": 3,
      "total": 4,
      "passRate": 75,
      "score": 3.03,
      "costPerTask": 2.16,
      "latency": 77,
      "toolCalls": 25.5,
      "note": "32/49"
    },
    {
      "category": "Charts",
      "model": "GPT-5.6 Sol",
      "provider": "Azure Foundry (OpenAI)",
      "tier": "High",
      "passed": 3,
      "total": 4,
      "passRate": 75,
      "score": 3.02,
      "costPerTask": 1.78,
      "latency": 68,
      "toolCalls": 17.8,
      "note": "37/49"
    },
    {
      "category": "Charts",
      "model": "GPT-5.6 Terra",
      "provider": "Azure Foundry (OpenAI)",
      "tier": "Med",
      "passed": 3,
      "total": 4,
      "passRate": 75,
      "score": 3,
      "costPerTask": 0.84,
      "latency": 73,
      "toolCalls": 17,
      "note": "36/49"
    },
    {
      "category": "Charts",
      "model": "GPT-5.5",
      "provider": "Azure Foundry (OpenAI)",
      "tier": "High",
      "passed": 3,
      "total": 4,
      "passRate": 75,
      "score": 3,
      "costPerTask": 0.7,
      "latency": 62,
      "toolCalls": 17.5,
      "note": "38/49"
    },
    {
      "category": "Charts",
      "model": "Claude Opus 4.8",
      "provider": "Bedrock (Anthropic)",
      "tier": "High",
      "passed": 3,
      "total": 4,
      "passRate": 75,
      "score": 3,
      "costPerTask": 1.94,
      "latency": 64,
      "toolCalls": 24.8,
      "note": "34/49"
    },
    {
      "category": "Charts",
      "model": "GPT-5.4",
      "provider": "Azure Foundry (OpenAI)",
      "tier": "Med",
      "passed": 3,
      "total": 4,
      "passRate": 75,
      "score": 3,
      "costPerTask": 0.83,
      "latency": 43,
      "toolCalls": 21,
      "note": "28/49"
    },
    {
      "category": "Charts",
      "model": "GLM 5.3 (FW)",
      "provider": "Azure Foundry (Fireworks)",
      "tier": "Med",
      "passed": 3,
      "total": 4,
      "passRate": 75,
      "score": 2.99,
      "costPerTask": 0.33,
      "latency": 324,
      "toolCalls": 34.8,
      "note": "34/49"
    },
    {
      "category": "Charts",
      "model": "DeepSeek V4.1 Flash",
      "provider": "Fireworks (direct)",
      "tier": "Low",
      "passed": 3,
      "total": 4,
      "passRate": 75,
      "score": 2.97,
      "costPerTask": 0.17,
      "latency": 153,
      "toolCalls": 34.5,
      "note": "38/49"
    },
    {
      "category": "Charts",
      "model": "Claude Sonnet 5",
      "provider": "Bedrock (Anthropic)",
      "tier": "Med",
      "passed": 3,
      "total": 4,
      "passRate": 75,
      "score": 2.95,
      "costPerTask": 0.81,
      "latency": 50,
      "toolCalls": 21.5,
      "note": "33/49"
    },
    {
      "category": "Charts",
      "model": "Claude Haiku 4.5",
      "provider": "Bedrock (Anthropic)",
      "tier": "Low",
      "passed": 2,
      "total": 4,
      "passRate": 50,
      "score": 2.54,
      "costPerTask": 0.15,
      "latency": 28,
      "toolCalls": 12.6,
      "note": "25/49"
    },
    {
      "category": "Charts",
      "model": "DeepSeek V4 Pro",
      "provider": "Azure Foundry (DeepSeek)",
      "tier": "High",
      "passed": 2,
      "total": 4,
      "passRate": 50,
      "score": 2.3,
      "costPerTask": 0.46,
      "latency": 70,
      "toolCalls": 23.2,
      "note": "33/49"
    },
    {
      "category": "Charts",
      "model": "DeepSeek V4 Flash",
      "provider": "Azure Foundry (DeepSeek)",
      "tier": "Low",
      "passed": 2,
      "total": 4,
      "passRate": 50,
      "score": 2.15,
      "costPerTask": 0.1,
      "latency": 105,
      "toolCalls": 29.8,
      "note": "32/49"
    },
    {
      "category": "Charts",
      "model": "Kimi K3 (FW)",
      "provider": "Azure Foundry (Fireworks)",
      "tier": "Med",
      "passed": 2,
      "total": 4,
      "passRate": 50,
      "score": 2.05,
      "costPerTask": 0.37,
      "latency": 117,
      "toolCalls": 32,
      "note": "33/49"
    },
    {
      "category": "Charts",
      "model": "Cohere Command A+",
      "provider": "Azure Foundry (Cohere)",
      "tier": "Med",
      "passed": 1,
      "total": 4,
      "passRate": 25,
      "score": 1.27,
      "costPerTask": 1.71,
      "latency": 160,
      "toolCalls": 44,
      "note": "9/49"
    },
    {
      "category": "Compound & Multi-turn",
      "model": "GPT-5.5",
      "provider": "Azure Foundry (OpenAI)",
      "tier": "High",
      "passed": 4,
      "total": 6,
      "passRate": 66.7,
      "score": 4.72,
      "costPerTask": 1.36,
      "latency": 59,
      "toolCalls": 21.5,
      "note": "38/49"
    },
    {
      "category": "Compound & Multi-turn",
      "model": "GPT-5.6 Sol",
      "provider": "Azure Foundry (OpenAI)",
      "tier": "High",
      "passed": 4,
      "total": 6,
      "passRate": 66.7,
      "score": 4.7,
      "costPerTask": 2.97,
      "latency": 47,
      "toolCalls": 21.3,
      "note": "37/49"
    },
    {
      "category": "Compound & Multi-turn",
      "model": "Claude Opus 4.6",
      "provider": "Bedrock (Anthropic)",
      "tier": "High",
      "passed": 4,
      "total": 6,
      "passRate": 66.7,
      "score": 4.7,
      "costPerTask": 1.97,
      "latency": 44,
      "toolCalls": 13.8,
      "note": "37/49"
    },
    {
      "category": "Compound & Multi-turn",
      "model": "GPT-5.6 Terra",
      "provider": "Azure Foundry (OpenAI)",
      "tier": "Med",
      "passed": 4,
      "total": 6,
      "passRate": 66.7,
      "score": 4.7,
      "costPerTask": 1.1,
      "latency": 49,
      "toolCalls": 18.5,
      "note": "36/49"
    },
    {
      "category": "Compound & Multi-turn",
      "model": "GPT-5.6 Luna",
      "provider": "Azure Foundry (OpenAI)",
      "tier": "Low",
      "passed": 4,
      "total": 6,
      "passRate": 66.7,
      "score": 4.7,
      "costPerTask": 0.13,
      "latency": 187,
      "toolCalls": 21.7,
      "note": "35/49"
    },
    {
      "category": "Compound & Multi-turn",
      "model": "DeepSeek V4 Pro",
      "provider": "Azure Foundry (DeepSeek)",
      "tier": "High",
      "passed": 4,
      "total": 6,
      "passRate": 66.7,
      "score": 4.7,
      "costPerTask": 0.54,
      "latency": 60,
      "toolCalls": 18.2,
      "note": "33/49"
    },
    {
      "category": "Compound & Multi-turn",
      "model": "Claude Sonnet 5",
      "provider": "Bedrock (Anthropic)",
      "tier": "Med",
      "passed": 4,
      "total": 6,
      "passRate": 66.7,
      "score": 4.5,
      "costPerTask": 0.64,
      "latency": 46,
      "toolCalls": 13.2,
      "note": "33/49"
    },
    {
      "category": "Compound & Multi-turn",
      "model": "GLM 5.3 (FW)",
      "provider": "Azure Foundry (Fireworks)",
      "tier": "Med",
      "passed": 4,
      "total": 6,
      "passRate": 66.7,
      "score": 4.45,
      "costPerTask": 0.43,
      "latency": 374,
      "toolCalls": 29.5,
      "note": "34/49"
    },
    {
      "category": "Compound & Multi-turn",
      "model": "Claude Opus 5",
      "provider": "Bedrock (Anthropic)",
      "tier": "High",
      "passed": 3,
      "total": 6,
      "passRate": 50,
      "score": 4.07,
      "costPerTask": 1.99,
      "latency": 36,
      "toolCalls": 13.2,
      "note": "32/49"
    },
    {
      "category": "Compound & Multi-turn",
      "model": "Kimi K3 (FW)",
      "provider": "Azure Foundry (Fireworks)",
      "tier": "Med",
      "passed": 3,
      "total": 6,
      "passRate": 50,
      "score": 4.07,
      "costPerTask": 0.32,
      "latency": 90,
      "toolCalls": 13.8,
      "note": "33/49"
    },
    {
      "category": "Compound & Multi-turn",
      "model": "Claude Opus 4.8",
      "provider": "Bedrock (Anthropic)",
      "tier": "High",
      "passed": 3,
      "total": 6,
      "passRate": 50,
      "score": 3.97,
      "costPerTask": 1.48,
      "latency": 35,
      "toolCalls": 13.3,
      "note": "34/49"
    },
    {
      "category": "Compound & Multi-turn",
      "model": "DeepSeek V4 Flash",
      "provider": "Azure Foundry (DeepSeek)",
      "tier": "Low",
      "passed": 3,
      "total": 6,
      "passRate": 50,
      "score": 3.96,
      "costPerTask": 0.1,
      "latency": 100,
      "toolCalls": 24.5,
      "note": "32/49"
    },
    {
      "category": "Compound & Multi-turn",
      "model": "Claude Sonnet 4.6",
      "provider": "Bedrock (Anthropic)",
      "tier": "Med",
      "passed": 3,
      "total": 6,
      "passRate": 50,
      "score": 3.95,
      "costPerTask": 0.94,
      "latency": 32,
      "toolCalls": 12.3,
      "note": "33/49"
    },
    {
      "category": "Compound & Multi-turn",
      "model": "Claude Haiku 4.5",
      "provider": "Bedrock (Anthropic)",
      "tier": "Low",
      "passed": 3,
      "total": 6,
      "passRate": 50,
      "score": 3.82,
      "costPerTask": 0.25,
      "latency": 28,
      "toolCalls": 12.8,
      "note": "25/49"
    },
    {
      "category": "Compound & Multi-turn",
      "model": "GPT-5.4",
      "provider": "Azure Foundry (OpenAI)",
      "tier": "Med",
      "passed": 3,
      "total": 6,
      "passRate": 50,
      "score": 3.71,
      "costPerTask": 1.45,
      "latency": 41,
      "toolCalls": 19,
      "note": "28/49"
    },
    {
      "category": "Compound & Multi-turn",
      "model": "DeepSeek V4.1 Flash",
      "provider": "Fireworks (direct)",
      "tier": "Low",
      "passed": 3,
      "total": 6,
      "passRate": 50,
      "score": 3.7,
      "costPerTask": 0.27,
      "latency": 125,
      "toolCalls": 53.7,
      "note": "38/49"
    },
    {
      "category": "Compound & Multi-turn",
      "model": "Cohere Command A+",
      "provider": "Azure Foundry (Cohere)",
      "tier": "Med",
      "passed": 0,
      "total": 6,
      "passRate": 0,
      "score": 0.5,
      "costPerTask": 2.14,
      "latency": 126,
      "toolCalls": 36,
      "note": "9/49"
    }
  ]
}
