evolution strategies for llm reasoning broader coverage
agentic esopt fine tuning long horizon llm agents with minimal gpu requirements