skillrank_skill Archive228/eval-harnessMIT · open registry

skill detail

← registry

Eval Harness

Archive228/eval-harness

Build a repeatable eval loop that grades agent output with an LLM judge, so prompt/skill changes get scored against a baseline instead of eyeballed. Reuses loopkit's verifier subagent as the grader — do not build a new one.

communityprovisionalaibuildrepeatableeval

skillrank score

██████░░░░░░░░░░38

SkillRank score blends community stars, real usage, and our eval lift; provisional until a skill is evaluated -- so popularity alone can't reach the top tier.

source

746

Archive228/loopkit

skills/eval-harness

open on GitHub ▸

eval status

eval pending

Success delta, token delta, and trial count are not available yet. No eval number is shown until this skill has measured results.

install

$ skillrank install Archive228/eval-harness
$ curl -fsSL skillrank.dev | sh