skill detail
← registryevaluating-code-models
Orchestra-Research/evaluating-code-models
Evaluates code generation models across HumanEval, MBPP, MultiPL-E, and 15+ benchmarks with pass@k metrics.
skillrank score
55
SkillRank score blends community stars, real usage, and our eval lift; provisional until a skill is evaluated -- so popularity alone can't reach the top tier.
source
★ 10.5k
Orchestra-Research/AI-Research-SKILLs
11-evaluation/bigcode-evaluation-harness
open on GitHub ▸eval status
eval pending
Success delta, token delta, and trial count are not available yet. No eval number is shown until this skill has measured results.
install
$ skillrank install Orchestra-Research/evaluating-code-models$ curl -fsSL skillrank.dev | sh