Evaluation

Measure Cortex performance with HaluMem metrics.

Cortex includes built-in evaluation tools to measure memory quality using the HaluMem framework.

Metrics

MetricDescription
Fabrication RateContent returned with no basis in stored memories
Conflict RateSuperseded or losing version returned
Omission RateCleared + relevant memory missed
Leakage RateOut-of-scope memory returned
Tokens per Correct AnswerEfficiency metric
Compression RatioOutput length vs input length

Running Evaluations

Via API

curl -X POST https://your-cortex-host/api/eval \
  -H "Authorization: Bearer crtx_YOUR_KEY_HERE" \
  -H "Content-Type: application/json" \
  -d '{
    "dataset": "default",
    "cases": 100
  }'

Response

{
  "run_id": "uuid",
  "dataset": "default",
  "cases": 100,
  "passed": 92,
  "fabrication_rate": 0.02,
  "conflict_rate": 0.03,
  "omission_rate": 0.05,
  "leakage_rate": 0.00,
  "tokens_per_correct_answer": 342,
  "compression_ratio": 2.1
}

Interpreting Results

Target Metrics

MetricTargetWarningCritical
Fabrication Rate< 5%5-10%> 10%
Conflict Rate< 5%5-10%> 10%
Omission Rate< 10%10-20%> 20%
Leakage Rate0%1-5%> 5%

Good Results

{
  "fabrication_rate": 0.02,
  "conflict_rate": 0.03,
  "omission_rate": 0.05,
  "leakage_rate": 0.00
}

This indicates:

  • 98% of returned content is grounded in stored memories
  • Only 3% of returns include superseded content
  • 5% of relevant memories were missed (within tolerance)
  • No out-of-scope content leaked

Improving Results

Reduce Fabrication

  • Ensure memories are comprehensive
  • Use facts for deterministic data
  • Tune similarity thresholds

Reduce Omission

  • Improve embedding quality
  • Adjust scope configurations
  • Add more relevant memories

Reduce Leakage

  • Verify policy configurations
  • Check scope assignments
  • Review clearance levels

Evaluations are logged to the eval_runs table for historical tracking. Run evaluations regularly to catch regressions.