Evaluation Datasets, Rubrics, and Edge Cases

Evaluation Datasets, Rubrics, and Edge Cases

Key jargon

Term Plain-language meaning
Evaluation dataset A set of cases used to measure system behavior.
Golden label A trusted expected answer, decision, or property for a case.
Rubric Explicit criteria and scoring levels for judgment.
Edge case A rare, difficult, or boundary input likely to expose failure.

Key concepts

Concept map

flowchart LR
    A["Collect representative and risky cases"] --> B["Define labels and rubrics"]
    B --> C["Stratify important slices"]
    C --> D["Version and protect test set"]

An evaluation item needs input, expected behavior, scoring method, provenance, task/subgroup labels, and review history.

Include normal cases, boundaries, adversarial-but-authorized cases, ambiguous requests, missing information, conflicts, unsupported tasks, long inputs, multilingual content, tool failures, permission denial, and safe abstention.

Rubric design

Exercise

Create 20 evaluation items for a document summarizer. Label source type, difficulty, expected facts, prohibited inventions, and scoring rubric.