Skip to content
AI Atlas
FrameworkActive

evals

OpenAIgithub.com/openai/evals

Evals is a framework for evaluating LLMs and LLM systems, and an open-source registry of benchmarks.

quality54

Updated 29 min ago · first seen 11 Sept 2026

framework_01M294NHSHM7YQDAFJSC10DRCG

Version
2.0.0
T2 · 2 h ago
Released
12 Jan 2024
T2 · 2 h ago
Stars
19,436
T2 · 29 min ago

As of

Rewind the record: see this entity's attributes exactly as AI Atlas knew them on a given day.

Claim history

14 claims · 14 properties

Repositoryrepository_url1

Claim history for Repository
ValueValid from → toStatusSourceConfidenceExtractor
https://github.com/openai/evalscurrentcurrentGitHub public repositories (HTML, releases.atom, raw files)T2mediumdeterministic

Created atcreated_at1

Claim history for Created at
ValueValid from → toStatusSourceConfidenceExtractor
23 Jan 2023currentcurrentGitHub public repositories (HTML, releases.atom, raw files)T2mediumdeterministic

Default branchdefault_branch1

Claim history for Default branch
ValueValid from → toStatusSourceConfidenceExtractor
maincurrentcurrentGitHub public repositories (HTML, releases.atom, raw files)T2mediumdeterministic

Descriptiondescription1

Claim history for Description
ValueValid from → toStatusSourceConfidenceExtractor
Evals is a framework for evaluating LLMs and LLM systems, and an open-source registry of benchmarks.currentcurrentGitHub public repositories (HTML, releases.atom, raw files)T2mediumdeterministic

Kindkind1

Claim history for Kind
ValueValid from → toStatusSourceConfidenceExtractor
toolcurrentcurrentGitHub public repositories (HTML, releases.atom, raw files)T2mediumdeterministic

Latest releaselatest_release_at1

Claim history for Latest release
ValueValid from → toStatusSourceConfidenceExtractor
12 Jan 2024currentcurrentGitHub public repositories (HTML, releases.atom, raw files)T2mediumdeterministic

Latest release taglatest_release_tag1

Claim history for Latest release tag
ValueValid from → toStatusSourceConfidenceExtractor
2.0.0currentcurrentGitHub public repositories (HTML, releases.atom, raw files)T2mediumdeterministic

Latest versionlatest_version1

Claim history for Latest version
ValueValid from → toStatusSourceConfidenceExtractor
2.0.0currentcurrentGitHub public repositories (HTML, releases.atom, raw files)T2mediumdeterministic

License namelicense_name1

Claim history for License name
ValueValid from → toStatusSourceConfidenceExtractor
OthercurrentcurrentGitHub public repositories (HTML, releases.atom, raw files)T2mediumdeterministic

Forksmetric.forks1

Claim history for Forks
ValueValid from → toStatusSourceConfidenceExtractor
3,083currentcurrentGitHub public repositories (HTML, releases.atom, raw files)T2mediumdeterministic

Starsmetric.stars1

Claim history for Stars
ValueValid from → toStatusSourceConfidenceExtractor
19,436currentcurrentGitHub public repositories (HTML, releases.atom, raw files)T2mediumdeterministic

Watchersmetric.watchers1

Claim history for Watchers
ValueValid from → toStatusSourceConfidenceExtractor
282currentcurrentGitHub public repositories (HTML, releases.atom, raw files)T2mediumdeterministic

Readme urlreadme_url1

Claim history for Readme url
ValueValid from → toStatusSourceConfidenceExtractor
https://raw.githubusercontent.com/openai/evals/HEAD/README.mdcurrentcurrentGitHub public repositories (HTML, releases.atom, raw files)T2mediumdeterministic

Releases urlreleases_url1

Claim history for Releases url
ValueValid from → toStatusSourceConfidenceExtractor
https://github.com/openai/evals/releasescurrentcurrentGitHub public repositories (HTML, releases.atom, raw files)T2mediumdeterministic

Claims are temporal and append-only: a new observation closes the previous claim (valid_to) instead of overwriting it. Conflicting claims from different sources are kept side by side and flagged — never averaged. Methodology →