research-document
Evidence Decision Record
Evidence Decision Record
EDR ID: EDR-ECR-000003-EXP001
ECR / Experiment: ECR-000003 EXP-001
Date:
Reviewer:
Status: draft / reviewed / accepted
Observation
- run_id: e2a2ed75-2dbc-46b4-a20d-742ea34a0393
- comparator_version: 3.1.0
- included_records: 12
- malformed_records: 0
- tolerant_parsing_events: 5
- structural_backbone_result: mixed
Interpretation
Human review required.
Explanations Weakened
Human review required.
Explanations Survived
Human review required.
Hypothesis Direction
Human review required.
Explainability Review
Highest-Priority Differences
- Baseline: gpt vs claude: high
- Baseline: gpt vs gemini: high
- Baseline: claude vs gemini: high
- Renumbered: gpt vs claude: high
- Renumbered: gpt vs gemini: high
- Renumbered: claude vs gemini: high
- Edge-Order Shuffled: gpt vs claude: high
- Edge-Order Shuffled: claude vs gemini: high
- Identity-Expanded: gpt vs claude: high
- Identity-Expanded: gpt vs gemini: high
Low-Significance Differences
- None recorded.
Material Backbone Differences
- Baseline: gpt vs claude: invented_edge
- Baseline: gpt vs claude: terminal_path_changed
- Baseline: gpt vs claude: terminal_path_changed
- Baseline: gpt vs claude: invented_edge
- Baseline: gpt vs claude: terminal_path_changed
- Baseline: gpt vs gemini: invented_edge
- Baseline: gpt vs gemini: invented_edge
- Baseline: gpt vs gemini: invented_edge
- Baseline: claude vs gemini: loop_target_changed
- Baseline: claude vs gemini: terminal_path_changed
Unresolved Classifications
- None recorded.
Compression / Elaboration Findings
- Baseline: gpt vs claude: partially_equivalent_expanded
- Baseline: gpt vs claude: partially_equivalent_expanded
- Baseline: gpt vs claude: partially_equivalent_expanded
- Baseline: gpt vs claude: partially_equivalent_expanded
- Baseline: gpt vs claude: partially_equivalent_expanded
- Baseline: gpt vs claude: partially_equivalent_expanded
- Baseline: gpt vs claude: partially_equivalent_expanded
- Baseline: gpt vs claude: partially_equivalent_expanded
- Baseline: gpt vs claude: partially_equivalent_expanded
- Baseline: gpt vs claude: partially_equivalent_expanded
Recognition / Structure Relationship
- Baseline: gpt vs claude: Recognition changed while the backbone remained stable.
- Baseline: gpt vs gemini: Recognition changed while the backbone remained stable.
- Baseline: claude vs gemini: Recognition changed while the backbone remained stable.
- Renumbered: gpt vs claude: Recognition changed while the backbone remained stable.
- Renumbered: claude vs gemini: Recognition changed while the backbone remained stable.
- Edge-Order Shuffled: gpt vs claude: Recognition changed while the backbone remained stable.
- Edge-Order Shuffled: gpt vs gemini: Recognition changed while the backbone remained stable.
- Edge-Order Shuffled: claude vs gemini: Recognition changed while the backbone remained stable.
- claude: P001A vs P001B: Both responses express only family resemblance rather than confident recognition.
- claude: P001A vs P001C: Both responses express only family resemblance rather than confident recognition.
Domain Leakage Impact
- None recorded.