# Papers

How we build and measure calibrated classifiers on open-weights language models. Every paper is available as Markdown
and PDF, and its results are measured on public data, reproducible with your own API key.

## 2026

- **[spinf/moderation: calibrated content moderation from plain-language questions](/papers/spinf-moderation)**
  · October 1, 2026 · [PDF](/papers/spinf-moderation.pdf) · [Markdown](/papers/spinf-moderation.md)

  How the moderation prompt-pack turns Gemma 4 12B into a content moderation classifier without fine-tuning: plain-language
  questions, per-option calibration, calibrated scores for every category and a safe / unsafe decision. Per-category and
  safe / unsafe results on public datasets, cost, what didn't work, and limitations.
