{
  "baseline": {
    "date": "2026-09-10",
    "model": "gemini-3.5-flash-lite",
    "fixtures": 12,
    "repeats": 3,
    "requests": 36,
    "errors": 0,
    "rawDisagreements": [
      {
        "fixture": "wrong-speaker",
        "repeat": 1,
        "criterion": "acknowledge",
        "expected": false,
        "actual": "not_assessed"
      },
      {
        "fixture": "wrong-speaker",
        "repeat": 1,
        "criterion": "plan",
        "expected": false,
        "actual": "not_assessed"
      },
      {
        "fixture": "wrong-speaker",
        "repeat": 1,
        "criterion": "no-guarantee",
        "expected": true,
        "actual": "not_assessed"
      },
      {
        "fixture": "wrong-speaker",
        "repeat": 2,
        "criterion": "acknowledge",
        "expected": false,
        "actual": "not_assessed"
      },
      {
        "fixture": "wrong-speaker",
        "repeat": 2,
        "criterion": "plan",
        "expected": false,
        "actual": "not_assessed"
      },
      {
        "fixture": "wrong-speaker",
        "repeat": 3,
        "criterion": "acknowledge",
        "expected": false,
        "actual": "not_assessed"
      },
      {
        "fixture": "wrong-speaker",
        "repeat": 3,
        "criterion": "plan",
        "expected": false,
        "actual": "not_assessed"
      }
    ],
    "reviewFlags": 0,
    "invalidCitations": 0,
    "criterionJudgements": 108,
    "varyingFixtureCriteria": [
      {
        "fixture": "wrong-speaker",
        "criterion": "no-guarantee",
        "statuses": [
          "not_assessed",
          "met",
          "met"
        ]
      }
    ],
    "inputTokens": 12252,
    "outputTokens": 5743
  },
  "followup": {
    "contract": "certesian.assessment.v1.1",
    "revalidatedExistingJudgements": 108,
    "beforeReviewFlags": 0,
    "afterReviewFlags": 7,
    "note": "Deterministic revalidation of saved outputs; no model calls for this comparison.",
    "followupRequests": 12,
    "followupErrors": 0,
    "followupJudgements": 30,
    "followupRawDisagreements": 0,
    "followupReviewFlags": 0,
    "limitation": "Targeted follow-up includes known failure fixtures and one added explicit out-of-scope fixture. It is not held-out generalisation evidence."
  }
}