FRAMES (<24k)

FRAMES (prompts under 24k tokens) - factuality/retrieval/reasoning benchmark as run in the AA eval-framework; overlength prompts score 0 on long-context benchmarks.

Category

Agentic

Max Score

100.0

Score Type

percent

Active

Yes

Model Scores

Scores for FRAMES (<24k)

Model Score Date Verified
Kolibri-1
100.00%
03.10.2026 Verified