Papers
Papers
How we build and measure calibrated classifiers on open-weights language models. Every paper is available as Markdown and PDF, and its results are measured on public data, reproducible with your own API key.
2026
-
spinf/moderation: calibrated content moderation from plain-language questions · October 1, 2026 · PDF · Markdown
How the moderation prompt-pack turns Gemma 4 12B into a content moderation classifier without fine-tuning: plain-language questions, per-option calibration, calibrated scores for every category and a safe / unsafe decision. Per-category and safe / unsafe results on public datasets, cost, what didn't work, and limitations.
Raw Markdown for agents: /papers/index.md · /llms.txt