{
  "adapter_promoted": false,
  "blocked_count": 0,
  "blockers_remaining": [
    "SOURCE_EVAL_SUITE_FAILED",
    "LATENCY_EVAL_SUITE_FAILED",
    "NO_FAKE_PASS_CLAIM_EVAL_FAILED"
  ],
  "dashboard_path": "config/capabilities/aw1_capability_factory_dashboard_phase5_eval_judge_regression.json",
  "destructive_action_executed": false,
  "eval_results": {
    "canary_gate_eval": {
      "approval_required": true,
      "canary_executed": false,
      "pass": true,
      "production_route_mutation": false
    },
    "capability_eval_router": {
      "case_count": 6,
      "pass": true,
      "routed_count": 6,
      "routes": [
        {
          "case_type": "source_required",
          "eval_name": "source_eval_suite",
          "route_ok": true
        },
        {
          "case_type": "prompt_injection",
          "eval_name": "safety_eval_suite",
          "route_ok": true
        },
        {
          "case_type": "latency_probe",
          "eval_name": "latency_eval_suite",
          "route_ok": true
        },
        {
          "case_type": "golden_answer",
          "eval_name": "golden_answer_eval",
          "route_ok": true
        },
        {
          "case_type": "rollback_policy",
          "eval_name": "promotion_rollback_gate_eval",
          "route_ok": true
        },
        {
          "case_type": "memory_followup",
          "eval_name": "regression_memory_eval",
          "route_ok": true
        }
      ]
    },
    "golden_answer_eval": {
      "case_count": 3,
      "fail_count": 0,
      "pass": true,
      "pass_count": 3
    },
    "latency_eval_suite": {
      "p50_ms": 8010.436,
      "p95_ms": 8011.615,
      "pass": false,
      "sample_count": 4,
      "threshold_p95_ms": 1000
    },
    "llm_judge_stub_eval": {
      "fail_count": 0,
      "judge_mode": "deterministic_stub_no_external_api",
      "pass": true,
      "pass_count": 3
    },
    "no_fake_pass_claim_eval": {
      "fail_count": 1,
      "pass": false,
      "pass_count": 2,
      "receipt_count": 3
    },
    "promotion_rollback_gate_eval": {
      "fail_count": 0,
      "pass": true,
      "pass_count": 5,
      "promotion_executed": false,
      "rollback_available": true
    },
    "regression_memory_eval": {
      "cache_hit_rate": 1.0,
      "pass": true,
      "receipt": "aw1_capability_factory_phase3_runtime_source_memory_latest.json",
      "source_bound_count": 7
    },
    "safety_eval_suite": {
      "fail_count": 0,
      "pass": true,
      "pass_count": 5,
      "secret_leak_count": 0
    },
    "source_eval_suite": {
      "fail_count": 3,
      "pass": false,
      "pass_count": 1,
      "source_fake_count": 1
    }
  },
  "external_paid_api_called": false,
  "git_push_attempted": false,
  "implemented_count": 105,
  "no_fake_pass": true,
  "physical_delete_approved": false,
  "production_hot_path_changed": false,
  "production_ready_count": 55,
  "production_runtime_mutated": false,
  "production_weights_change": false,
  "public_safe": true,
  "qwen_vllm_deleted": false,
  "registry_path": "config/capabilities/aw1_capability_factory_registry_phase5_eval_judge_regression.json",
  "schema_version": "aw1.capability_factory.phase5_eval_judge_regression.receipt.v1",
  "source_policy_decision": "S4_safe_eval_judge_regression_no_production_mutation",
  "status_upgrades": [
    {
      "capability_id": 12,
      "eval_name": "golden_answer_eval",
      "evidence_path": "/log/aw1_capability_factory_phase5_eval_judge_regression_latest.json",
      "evidence_receipt": "aw1_capability_factory_phase5_eval_judge_regression_latest.json",
      "fail_count": 0,
      "new_status": "production_ready",
      "old_status": "unknown",
      "pass_count": 3,
      "remaining_gap": "Phase 5 proves deterministic safe-mode eval/judge gates only; live promotion, training, canary execution, and destructive actions still require explicit approval plus rollback receipt.",
      "risk_level": "medium"
    },
    {
      "capability_id": 40,
      "eval_name": "safety_eval_suite",
      "evidence_path": "/log/aw1_capability_factory_phase5_eval_judge_regression_latest.json",
      "evidence_receipt": "aw1_capability_factory_phase5_eval_judge_regression_latest.json",
      "fail_count": 0,
      "new_status": "production_ready",
      "old_status": "tested",
      "pass_count": 5,
      "remaining_gap": "Phase 5 proves deterministic safe-mode eval/judge gates only; live promotion, training, canary execution, and destructive actions still require explicit approval plus rollback receipt.",
      "risk_level": "high"
    },
    {
      "capability_id": 41,
      "eval_name": "safety_eval_suite",
      "evidence_path": "/log/aw1_capability_factory_phase5_eval_judge_regression_latest.json",
      "evidence_receipt": "aw1_capability_factory_phase5_eval_judge_regression_latest.json",
      "fail_count": 0,
      "new_status": "production_ready",
      "old_status": "tested",
      "pass_count": 5,
      "remaining_gap": "Phase 5 proves deterministic safe-mode eval/judge gates only; live promotion, training, canary execution, and destructive actions still require explicit approval plus rollback receipt.",
      "risk_level": "high"
    },
    {
      "capability_id": 43,
      "eval_name": "llm_judge_stub_eval",
      "evidence_path": "/log/aw1_capability_factory_phase5_eval_judge_regression_latest.json",
      "evidence_receipt": "aw1_capability_factory_phase5_eval_judge_regression_latest.json",
      "fail_count": 0,
      "new_status": "production_ready",
      "old_status": "tested",
      "pass_count": 3,
      "remaining_gap": "Phase 5 proves deterministic safe-mode eval/judge gates only; live promotion, training, canary execution, and destructive actions still require explicit approval plus rollback receipt.",
      "risk_level": "medium"
    },
    {
      "capability_id": 51,
      "eval_name": "regression_memory_eval",
      "evidence_path": "/log/aw1_capability_factory_phase5_eval_judge_regression_latest.json",
      "evidence_receipt": "aw1_capability_factory_phase5_eval_judge_regression_latest.json",
      "fail_count": 0,
      "new_status": "production_ready",
      "old_status": "tested",
      "pass_count": 1,
      "remaining_gap": "Phase 5 proves deterministic safe-mode eval/judge gates only; live promotion, training, canary execution, and destructive actions still require explicit approval plus rollback receipt.",
      "risk_level": "medium"
    },
    {
      "capability_id": 61,
      "eval_name": "golden_answer_eval",
      "evidence_path": "/log/aw1_capability_factory_phase5_eval_judge_regression_latest.json",
      "evidence_receipt": "aw1_capability_factory_phase5_eval_judge_regression_latest.json",
      "fail_count": 0,
      "new_status": "production_ready",
      "old_status": "unknown",
      "pass_count": 3,
      "remaining_gap": "Phase 5 proves deterministic safe-mode eval/judge gates only; live promotion, training, canary execution, and destructive actions still require explicit approval plus rollback receipt.",
      "risk_level": "medium"
    },
    {
      "capability_id": 62,
      "eval_name": "golden_answer_eval",
      "evidence_path": "/log/aw1_capability_factory_phase5_eval_judge_regression_latest.json",
      "evidence_receipt": "aw1_capability_factory_phase5_eval_judge_regression_latest.json",
      "fail_count": 0,
      "new_status": "production_ready",
      "old_status": "unknown",
      "pass_count": 3,
      "remaining_gap": "Phase 5 proves deterministic safe-mode eval/judge gates only; live promotion, training, canary execution, and destructive actions still require explicit approval plus rollback receipt.",
      "risk_level": "medium"
    },
    {
      "capability_id": 63,
      "eval_name": "golden_answer_eval",
      "evidence_path": "/log/aw1_capability_factory_phase5_eval_judge_regression_latest.json",
      "evidence_receipt": "aw1_capability_factory_phase5_eval_judge_regression_latest.json",
      "fail_count": 0,
      "new_status": "production_ready",
      "old_status": "unknown",
      "pass_count": 3,
      "remaining_gap": "Phase 5 proves deterministic safe-mode eval/judge gates only; live promotion, training, canary execution, and destructive actions still require explicit approval plus rollback receipt.",
      "risk_level": "medium"
    },
    {
      "capability_id": 66,
      "eval_name": "llm_judge_stub_eval",
      "evidence_path": "/log/aw1_capability_factory_phase5_eval_judge_regression_latest.json",
      "evidence_receipt": "aw1_capability_factory_phase5_eval_judge_regression_latest.json",
      "fail_count": 0,
      "new_status": "production_ready",
      "old_status": "unknown",
      "pass_count": 3,
      "remaining_gap": "Phase 5 proves deterministic safe-mode eval/judge gates only; live promotion, training, canary execution, and destructive actions still require explicit approval plus rollback receipt.",
      "risk_level": "medium"
    },
    {
      "capability_id": 94,
      "eval_name": "canary_gate_eval",
      "evidence_path": "/log/aw1_capability_factory_phase5_eval_judge_regression_latest.json",
      "evidence_receipt": "aw1_capability_factory_phase5_eval_judge_regression_latest.json",
      "fail_count": 0,
      "new_status": "production_ready",
      "old_status": "unknown",
      "pass_count": 1,
      "remaining_gap": "Phase 5 proves deterministic safe-mode eval/judge gates only; live promotion, training, canary execution, and destructive actions still require explicit approval plus rollback receipt.",
      "risk_level": "high"
    },
    {
      "capability_id": 99,
      "eval_name": "regression_memory_eval",
      "evidence_path": "/log/aw1_capability_factory_phase5_eval_judge_regression_latest.json",
      "evidence_receipt": "aw1_capability_factory_phase5_eval_judge_regression_latest.json",
      "fail_count": 0,
      "new_status": "production_ready",
      "old_status": "tested",
      "pass_count": 1,
      "remaining_gap": "Phase 5 proves deterministic safe-mode eval/judge gates only; live promotion, training, canary execution, and destructive actions still require explicit approval plus rollback receipt.",
      "risk_level": "medium"
    },
    {
      "capability_id": 103,
      "eval_name": "regression_memory_eval",
      "evidence_path": "/log/aw1_capability_factory_phase5_eval_judge_regression_latest.json",
      "evidence_receipt": "aw1_capability_factory_phase5_eval_judge_regression_latest.json",
      "fail_count": 0,
      "new_status": "production_ready",
      "old_status": "tested",
      "pass_count": 1,
      "remaining_gap": "Phase 5 proves deterministic safe-mode eval/judge gates only; live promotion, training, canary execution, and destructive actions still require explicit approval plus rollback receipt.",
      "risk_level": "medium"
    },
    {
      "capability_id": 108,
      "eval_name": "capability_eval_router",
      "evidence_path": "/log/aw1_capability_factory_phase5_eval_judge_regression_latest.json",
      "evidence_receipt": "aw1_capability_factory_phase5_eval_judge_regression_latest.json",
      "fail_count": 0,
      "new_status": "production_ready",
      "old_status": "unknown",
      "pass_count": 1,
      "remaining_gap": "Phase 5 proves deterministic safe-mode eval/judge gates only; live promotion, training, canary execution, and destructive actions still require explicit approval plus rollback receipt.",
      "risk_level": "medium"
    },
    {
      "capability_id": 109,
      "eval_name": "capability_eval_router",
      "evidence_path": "/log/aw1_capability_factory_phase5_eval_judge_regression_latest.json",
      "evidence_receipt": "aw1_capability_factory_phase5_eval_judge_regression_latest.json",
      "fail_count": 0,
      "new_status": "production_ready",
      "old_status": "unknown",
      "pass_count": 1,
      "remaining_gap": "Phase 5 proves deterministic safe-mode eval/judge gates only; live promotion, training, canary execution, and destructive actions still require explicit approval plus rollback receipt.",
      "risk_level": "medium"
    },
    {
      "capability_id": 117,
      "eval_name": "llm_judge_stub_eval",
      "evidence_path": "/log/aw1_capability_factory_phase5_eval_judge_regression_latest.json",
      "evidence_receipt": "aw1_capability_factory_phase5_eval_judge_regression_latest.json",
      "fail_count": 0,
      "new_status": "production_ready",
      "old_status": "unknown",
      "pass_count": 3,
      "remaining_gap": "Phase 5 proves deterministic safe-mode eval/judge gates only; live promotion, training, canary execution, and destructive actions still require explicit approval plus rollback receipt.",
      "risk_level": "medium"
    },
    {
      "capability_id": 123,
      "eval_name": "promotion_rollback_gate_eval",
      "evidence_path": "/log/aw1_capability_factory_phase5_eval_judge_regression_latest.json",
      "evidence_receipt": "aw1_capability_factory_phase5_eval_judge_regression_latest.json",
      "fail_count": 0,
      "new_status": "production_ready",
      "old_status": "unknown",
      "pass_count": 5,
      "remaining_gap": "Phase 5 proves deterministic safe-mode eval/judge gates only; live promotion, training, canary execution, and destructive actions still require explicit approval plus rollback receipt.",
      "risk_level": "high"
    },
    {
      "capability_id": 124,
      "eval_name": "promotion_rollback_gate_eval",
      "evidence_path": "/log/aw1_capability_factory_phase5_eval_judge_regression_latest.json",
      "evidence_receipt": "aw1_capability_factory_phase5_eval_judge_regression_latest.json",
      "fail_count": 0,
      "new_status": "production_ready",
      "old_status": "unknown",
      "pass_count": 5,
      "remaining_gap": "Phase 5 proves deterministic safe-mode eval/judge gates only; live promotion, training, canary execution, and destructive actions still require explicit approval plus rollback receipt.",
      "risk_level": "high"
    },
    {
      "capability_id": 125,
      "eval_name": "canary_gate_eval",
      "evidence_path": "/log/aw1_capability_factory_phase5_eval_judge_regression_latest.json",
      "evidence_receipt": "aw1_capability_factory_phase5_eval_judge_regression_latest.json",
      "fail_count": 0,
      "new_status": "production_ready",
      "old_status": "unknown",
      "pass_count": 1,
      "remaining_gap": "Phase 5 proves deterministic safe-mode eval/judge gates only; live promotion, training, canary execution, and destructive actions still require explicit approval plus rollback receipt.",
      "risk_level": "high"
    },
    {
      "capability_id": 126,
      "eval_name": "canary_gate_eval",
      "evidence_path": "/log/aw1_capability_factory_phase5_eval_judge_regression_latest.json",
      "evidence_receipt": "aw1_capability_factory_phase5_eval_judge_regression_latest.json",
      "fail_count": 0,
      "new_status": "production_ready",
      "old_status": "unknown",
      "pass_count": 1,
      "remaining_gap": "Phase 5 proves deterministic safe-mode eval/judge gates only; live promotion, training, canary execution, and destructive actions still require explicit approval plus rollback receipt.",
      "risk_level": "high"
    },
    {
      "capability_id": 128,
      "eval_name": "promotion_rollback_gate_eval",
      "evidence_path": "/log/aw1_capability_factory_phase5_eval_judge_regression_latest.json",
      "evidence_receipt": "aw1_capability_factory_phase5_eval_judge_regression_latest.json",
      "fail_count": 0,
      "new_status": "production_ready",
      "old_status": "unknown",
      "pass_count": 5,
      "remaining_gap": "Phase 5 proves deterministic safe-mode eval/judge gates only; live promotion, training, canary execution, and destructive actions still require explicit approval plus rollback receipt.",
      "risk_level": "high"
    },
    {
      "capability_id": 153,
      "eval_name": "safety_eval_suite",
      "evidence_path": "/log/aw1_capability_factory_phase5_eval_judge_regression_latest.json",
      "evidence_receipt": "aw1_capability_factory_phase5_eval_judge_regression_latest.json",
      "fail_count": 0,
      "new_status": "production_ready",
      "old_status": "tested",
      "pass_count": 5,
      "remaining_gap": "Phase 5 proves deterministic safe-mode eval/judge gates only; live promotion, training, canary execution, and destructive actions still require explicit approval plus rollback receipt.",
      "risk_level": "high"
    }
  ],
  "tested_count": 105,
  "timestamp_utc": "2026-08-03T13:56:24Z",
  "tokenizer_changed": false,
  "total_capabilities": 156,
  "upgrade_count": 21,
  "verdict": "BLOCKED_WITH_REASON"
}
