← Voltar para o catálogo

evaluating-llms-harness

Evaluates LLMs across 60+ academic benchmarks (MMLU, HumanEval, GSM8K, TruthfulQA, HellaSwag). Use when benchmarking model quality, comparing models, reporting academic results, or tracking training progress. Industry standard used by EleutherAI, HuggingFace, and major labs. Supports HuggingFace, vLLM, APIs.

1.5kestrelas
Atualizado há 2 meses

Ver no GitHub ↗Licença: MIT

Como adicionar

/plugin marketplace add OpenRaiser/NanoResearch

O comando exato pode variar conforme o repositório. Confira o README no GitHub.

Para o autor da skill

Cole no README do seu repo

Mostra que sua skill está catalogada na Skillteca, gera backlink e tráfego rastreável.

Listada na Skillteca
[![Listada na Skillteca](https://www.skillteca.com.br/api/badge/evaluating-llms-harness-openraiser/svg)](https://www.skillteca.com.br/skills/evaluating-llms-harness-openraiser?utm_source=badge&utm_medium=readme&utm_campaign=badge)

Alerta por categoria

Receba novas skills de Pesquisa e Web toda segunda

1 email curto, só com as skills novas de Pesquisa e Web. 4 minutos de leitura, sem spam, cancela com 1 clique.

Você confirma o email no primeiro envio. Sem spam. Cancela com 1 clique.

CompartilharXLinkedIn

Comentários · Nenhum comentário

  • Ainda não há comentários. Seja o primeiro.