Large language model testing and evaluation — model integration, evaluation metrics, LLM-specific assertions, RAG evaluation, and security evaluation examples.