{
  "project": "LLMath",
  "sha": "c0f450ebbee1c6b31875efddf450ac3f9eb321bd",
  "baselineName": "Prompted-LLM baseline (model only, no tools/retrieval) on TheoremQA",
  "conditions": {
    "n": "800 TheoremQA test questions",
    "machine": "n/a (LLM eval; fine-tuned DeepSeek-Math 7B LoRA + FAISS + SymPy)",
    "compiler": "Python; ablation ladder baseline -> RAG -> manual -> autonomous ReAct"
  },
  "series": [
    {
      "workload": "TheoremQA accuracy (autonomous ReAct vs prompted-LLM baseline)",
      "subject_value": 77.6,
      "baseline_value": 41.2,
      "ratio": 1.8835,
      "unit": "% accuracy",
      "lowerIsBetter": false
    },
    {
      "workload": "TheoremQA accuracy (RAG vs baseline)",
      "subject_value": 58.1,
      "baseline_value": 41.2,
      "ratio": 1.41019,
      "unit": "% accuracy",
      "lowerIsBetter": false
    },
    {
      "workload": "TheoremQA accuracy (manual tools vs baseline)",
      "subject_value": 69.8,
      "baseline_value": 41.2,
      "ratio": 1.69417,
      "unit": "% accuracy",
      "lowerIsBetter": false
    },
    {
      "workload": "Token efficiency (autonomous vs baseline, tokens/correct)",
      "subject_value": 2688.7,
      "baseline_value": 4180.5,
      "ratio": 0.643153,
      "unit": "tokens/correct",
      "lowerIsBetter": true
    }
  ],
  "notes": "SAMPLE/DEMO DATA — sourced from benchmarks/results.sample.json (also hardcoded as plot fallback); these figures are documented-only, NOT a recorded real run, and the resume headline frames them as a 'documented ablation'. Accuracy higher is better: autonomous 77.6% vs baseline 41.2% (RAG 58.1%, manual 69.8%). Token efficiency is tokens-per-correct, lower is better: autonomous 2688.7 vs baseline 4180.5 (~36% fewer). Autonomous mode also reports tool_call_precision 0.912, retrieval_recall_at_k 0.689, avg_iterations 3.4 (single-config diagnostics, not subject-vs-baseline series)."
}
