{
  "kind": "tracker",
  "studySlug": "model-divergence",
  "slug": "cross-model-consensus-tracker",
  "title": "Cross-model consensus benchmark",
  "description": "Top-line agreement metrics across the full 8-model comparison set.",
  "lastUpdated": "2026-03-11",
  "lastTested": "2026-03-11",
  "sourceStudyUrl": "/trakkr-research/model-divergence",
  "sourceStudyTitle": "Same Question, Different AI, Different Answers",
  "claimIds": [
    "model-divergence:avg-agreement",
    "model-divergence:perfect-agreement",
    "model-divergence:high-divergence",
    "model-divergence:top3-overlap"
  ],
  "relatedSlugs": [
    "answer:how-often-is-there-perfect-consensus-across-models",
    "answer:how-much-do-models-disagree-on-brand-recommendations",
    "fact:only-four-percent-of-prompts-produce-perfect-consensus"
  ],
  "methodologySummary": "Built from 797,644 valid comparisons across 44,088 reports and 8 models, covering 6,439,133 model responses in the observed window.",
  "limitations": [
    "Agreement is measured across recommendation outputs, not across hidden reasoning or retrieval context.",
    "Average agreement can hide large differences between query classes and model pairs.",
    "The study measures overlap, not which answer was objectively “right”."
  ],
  "keywords": [
    "model divergence",
    "AI agreement",
    "ChatGPT vs Claude",
    "Gemini vs Perplexity"
  ],
  "schemaHints": {
    "pageType": "WebPage",
    "includeDataset": true,
    "includeItemList": true,
    "itemListName": "Cross-model consensus benchmark"
  },
  "summary": "The 8-model benchmark shows partial overlap, low perfect consensus, and a persistent divergence tail.",
  "keyFacts": [
    {
      "label": "Average agreement",
      "value": "43.3%",
      "detail": "Mean cross-model agreement rate.",
      "claimId": "model-divergence:avg-agreement"
    },
    {
      "label": "Perfect agreement",
      "value": "4.0%",
      "detail": "Only a small share of prompts produce unanimous outcomes.",
      "claimId": "model-divergence:perfect-agreement"
    },
    {
      "label": "High divergence rate",
      "value": "14.6%",
      "detail": "Prompts in the 0-25% agreement bucket.",
      "claimId": "model-divergence:high-divergence"
    },
    {
      "label": "Average top 3 overlap",
      "value": "2.8",
      "detail": "Average overlap among top-three results across models.",
      "claimId": "model-divergence:top3-overlap"
    }
  ],
  "benchmarkRows": [
    {
      "label": "Average agreement",
      "value": "43.3%",
      "note": "Mean cross-model agreement rate."
    },
    {
      "label": "Perfect agreement",
      "value": "4.0%",
      "note": "Only a small share of prompts produce unanimous outcomes."
    },
    {
      "label": "High divergence rate",
      "value": "14.6%",
      "note": "Prompts in the 0-25% agreement bucket."
    },
    {
      "label": "Average top 3 overlap",
      "value": "2.8",
      "note": "Average overlap among top-three results across models."
    }
  ],
  "rankedItems": [
    {
      "name": "Average agreement",
      "value": "43.3%",
      "detail": "The central tendency of cross-model overlap."
    },
    {
      "name": "High-divergence prompts",
      "value": "14.6%",
      "detail": "The share of prompts with the weakest overlap."
    },
    {
      "name": "Perfect agreement",
      "value": "4.0%",
      "detail": "The rare case where all models converge fully."
    },
    {
      "name": "Average top-three overlap",
      "value": "2.8",
      "detail": "Overlap exists, but not enough to treat lists as identical."
    }
  ],
  "changes": [
    {
      "title": "Consensus is partial, not total",
      "detail": "Most prompts live in the middle ground rather than perfect agreement or total chaos."
    },
    {
      "title": "The divergence tail is operationally important",
      "detail": "A 14.6% high-divergence rate is large enough to move market share across models."
    }
  ]
}
