Avaliação contínua de LLMs: datasets de regressão que sobrevivem à troca de modelo
Como montar um dataset de regressão a partir de casos reais, escolher métricas que importam e usar LLM-as-judge calibrado por revisão humana para travar deploys ruins no CI.
