Sari la conținut

Eval-uri per rol

Acest conținut nu este încă disponibil în limba selectată.

Declanșator obligatoriu: orice modificare de agents/*.md, de tools:, sau de configurație de rutare pe modele. Fără asta, rutarea multi-model e o variabilă netestată înmulțită cu o organigramă netestată.

Rutarea Claude/GLM/Kimi face fiecare agent funcție de prompt ȘI model. Cercetarea pe structuri organizaționale arată că configurația câștigătoare se inversează la schimbarea modelului. Un agent care merge pe Claude poate degrada tăcut pe GLM — iar dacă e un agent de verificare, degradarea înseamnă „verde” fals.

  1. 20 de task-uri golden per rol, versionate în Git lângă definiția agentului. Douăzeci e suficient: modificările timpurii au efecte mari, deci eșantioane mici le prind.
  2. Un singur LLM-judecător, rubrică unificată 0.0–1.0 (acuratețe factuală, acuratețea citărilor, completitudine, calitatea surselor, eficiența uneltelor). Un judecător cu o rubrică bate mai mulți judecători cu rubrici separate.
  3. Notează starea finală, nu procesul. Agenții iau legitim căi diferite spre același rezultat.
  4. Verificator uman pentru halucinații și selecția greșită de surse — LLM-judecătorul le ratează sistematic.
  5. 100% din rulări trec prin verificări deterministe; 10–20% prin notare cu LLM.
  • rol de verificare (reviewer, qa-runner, api-governor, security-governor): ≥ 0.85
  • rol de producție de artefacte: ≥ 0.70
  • sub prag → schimbarea nu intră; se escaladează modelul, nu se relaxează pragul.

Scor per rol, delta față de rularea anterioară, task-urile care au regresat (nominal), și recomandarea: acceptă / escaladează modelul / respinge schimbarea.