research-document

Evidence Decision Record

Evidence Decision Record

EDR ID: EDR-ECR-000003-EXP001

ECR / Experiment: ECR-000003 EXP-001

Date:

Reviewer:

Status: draft / reviewed / accepted

Observation

  • run_id: e2a2ed75-2dbc-46b4-a20d-742ea34a0393
  • comparator_version: 3.1.0
  • included_records: 12
  • malformed_records: 0
  • tolerant_parsing_events: 5
  • structural_backbone_result: mixed

Interpretation

Human review required.

Explanations Weakened

Human review required.

Explanations Survived

Human review required.

Hypothesis Direction

Human review required.

Explainability Review

Highest-Priority Differences

  • Baseline: gpt vs claude: high
  • Baseline: gpt vs gemini: high
  • Baseline: claude vs gemini: high
  • Renumbered: gpt vs claude: high
  • Renumbered: gpt vs gemini: high
  • Renumbered: claude vs gemini: high
  • Edge-Order Shuffled: gpt vs claude: high
  • Edge-Order Shuffled: claude vs gemini: high
  • Identity-Expanded: gpt vs claude: high
  • Identity-Expanded: gpt vs gemini: high

Low-Significance Differences

  • None recorded.

Material Backbone Differences

  • Baseline: gpt vs claude: invented_edge
  • Baseline: gpt vs claude: terminal_path_changed
  • Baseline: gpt vs claude: terminal_path_changed
  • Baseline: gpt vs claude: invented_edge
  • Baseline: gpt vs claude: terminal_path_changed
  • Baseline: gpt vs gemini: invented_edge
  • Baseline: gpt vs gemini: invented_edge
  • Baseline: gpt vs gemini: invented_edge
  • Baseline: claude vs gemini: loop_target_changed
  • Baseline: claude vs gemini: terminal_path_changed

Unresolved Classifications

  • None recorded.

Compression / Elaboration Findings

  • Baseline: gpt vs claude: partially_equivalent_expanded
  • Baseline: gpt vs claude: partially_equivalent_expanded
  • Baseline: gpt vs claude: partially_equivalent_expanded
  • Baseline: gpt vs claude: partially_equivalent_expanded
  • Baseline: gpt vs claude: partially_equivalent_expanded
  • Baseline: gpt vs claude: partially_equivalent_expanded
  • Baseline: gpt vs claude: partially_equivalent_expanded
  • Baseline: gpt vs claude: partially_equivalent_expanded
  • Baseline: gpt vs claude: partially_equivalent_expanded
  • Baseline: gpt vs claude: partially_equivalent_expanded

Recognition / Structure Relationship

  • Baseline: gpt vs claude: Recognition changed while the backbone remained stable.
  • Baseline: gpt vs gemini: Recognition changed while the backbone remained stable.
  • Baseline: claude vs gemini: Recognition changed while the backbone remained stable.
  • Renumbered: gpt vs claude: Recognition changed while the backbone remained stable.
  • Renumbered: claude vs gemini: Recognition changed while the backbone remained stable.
  • Edge-Order Shuffled: gpt vs claude: Recognition changed while the backbone remained stable.
  • Edge-Order Shuffled: gpt vs gemini: Recognition changed while the backbone remained stable.
  • Edge-Order Shuffled: claude vs gemini: Recognition changed while the backbone remained stable.
  • claude: P001A vs P001B: Both responses express only family resemblance rather than confident recognition.
  • claude: P001A vs P001C: Both responses express only family resemblance rather than confident recognition.

Domain Leakage Impact

  • None recorded.