Systematically evaluate LLM output quality — metric selection, multi-run comparison experiments, RAG system evaluation, and model selection decisions.