What failed?
MODEL-C1
- When
- Batch 9
- How badly
- Macro-F1 0.170
- Protocol
- FIXED_ORIGIN_B1
- Experiment
BASE-FIXED-C1-001
Worst chronological cases and explanation behavior around frozen failure-context audit samples.
BASE-FIXED-C1-001BASE-FIXED-C2-001BASE-FIXED-C3-001BASE-FIXED-C4-001Source: results/baselines/fixed_origin_metrics.csv. Unit: proportion; fixed-origin protocol.
Natural-neighbor stability summaries use frozen Stage 09 audit samples; they are not repeated observations of one physical event.
| Model | Context | N pairs | Explanation distance | Jaccard@10 |
|---|---|---|---|---|
| MODEL-C1 | CORRECT_REPRESENTATIVE | 64 | 0.208 | 0.509 |
| MODEL-C1 | MISCLASSIFIED | 70 | 0.151 | 0.683 |
| MODEL-C1 | MISCLASSIFIED,NEAR_DECISION_BOUNDARY | 6 | 0.083 | 0.721 |
| MODEL-C1 | NEAR_DECISION_BOUNDARY | 56 | 0.231 | 0.481 |
| MODEL-C2 | CORRECT_REPRESENTATIVE | 28 | 0.289 | 0.584 |
| MODEL-C2 | MISCLASSIFIED | 41 | 0.325 | 0.533 |
| MODEL-C2 | MISCLASSIFIED,NEAR_DECISION_BOUNDARY | 3 | 0.163 | 0.768 |
| MODEL-C2 | NEAR_DECISION_BOUNDARY | 25 | 0.213 | 0.694 |
| MODEL-C3 | CORRECT_REPRESENTATIVE | 32 | 0.237 | 0.480 |
| MODEL-C3 | MISCLASSIFIED | 33 | 0.160 | 0.657 |
| MODEL-C3 | NEAR_DECISION_BOUNDARY | 25 | 0.191 | 0.539 |
| MODEL-C4 | CORRECT_REPRESENTATIVE | 32 | 0.281 | 0.438 |
| MODEL-C4 | MISCLASSIFIED | 30 | 0.222 | 0.512 |
| MODEL-C4 | NEAR_DECISION_BOUNDARY | 13 | 0.284 | 0.438 |
Sources: results/xai/stage10_fidelity_local.csv and results/xai/stage11_local_neighbor_stability.csv. The evidence does not support a general claim that explanations become less stable exactly when predictions fail.