TOOLHAZARD: SCALING ADVERSARIAL ENVIRONMENTS FOR SECURITY EVALUATION AND ALIGNMENT OF LLM-BASED AGENTS