skillrank_skill sangrokjung/evaluating-llms-harnessMIT · open registry

skill detail

← registry

Evaluating Llms Harness

sangrokjung/evaluating-llms-harness

Evaluates LLMs across 60+ academic benchmarks (MMLU, HumanEval, GSM8K, TruthfulQA, HellaSwag). Use when benchmarking model quality, comparing models, reporting academic results, or tracking training progress. Industry standard used by EleutherAI, HuggingFace, and major labs....

communityprovisionalaievaluatesllmsacross

skillrank score

██████░░░░░░░░░░38

SkillRank score blends community stars, real usage, and our eval lift; provisional until a skill is evaluated -- so popularity alone can't reach the top tier.

source

801

sangrokjung/claude-forge

skills/evaluating-llms-harness

open on GitHub ▸

eval status

eval pending

Success delta, token delta, and trial count are not available yet. No eval number is shown until this skill has measured results.

install

$ skillrank install sangrokjung/evaluating-llms-harness
$ curl -fsSL skillrank.dev | sh