ModelRefs / MuSR Methodology — Methodology

MuSR Methodology — Methodology

MuSR evaluates multi-step soft reasoning on narratives (murder mysteries, object placement, team allocation).

Overview

What it measures: Long-context narrative reasoning requiring chained inferences.

How it works

  • Stories generated by LLMs and validated by humans.
  • Each story poses a reasoning question requiring 4–8 inference steps.
  • Multiple choice scoring.

Strengths

  • Tests long-context inference
  • Resistant to shortcut heuristics

Limitations

  • LLM-generated narratives can leak structure
  • Small set

Best use cases

Reasoning + long-context evaluation

Continue your research

Use these connected ModelRefs sections to compare alternatives, inspect implementation paths, and review the evidence and governance boundaries relevant to MuSR Methodology — Methodology.

Frequently asked questions

What does MuSR measure?

Long-context narrative reasoning requiring chained inferences.

What are its main limitations?

LLM-generated narratives can leak structure Small set

When should I use this benchmark?

Reasoning + long-context evaluation