Measures recall accuracy vs tokens retained across compaction policies. Real transcripts in, LLM-generated recall exam from the summarized region, per-policy answer+judge passes, scorecard out.