Benchmark + métricas de retrieval da Wiki MIA.
Filtros por modelo/pergunta/condição. Side-by-side por modelo (Leve / Média / Sem Wiki). Score do judge (4 dimensões) em cada resposta.
Ranking modelos · Wiki ON vs OFF · custo × benefício · agregados por modo.
Teste anterior com modelos top (GPT-5.4, Claude 4.6 etc) e perguntas genéricas — Wiki PIOROU (-4.4%). Mantido pra comparação.
Texto completo de cada resposta dos modelos por pergunta × condição. Útil pra leitura sequencial.
Plan completo (skills, subagentes, tools) e chunks recuperados pra cada query do bench anterior.
VPS srv1493385 · mia-platform · Easypanel Traefik