LLM Reasoning Evaluation
Meter Pavilion - AI Evaluation & Reasoning Analysis
Evaluated large language model reasoning, instruction following, and multi-step problem-solving through structured evaluation workflows to improve model alignment and benchmark quality.