Mercor
$48–68/hr
36 people hired
AI Safety Expert responsible for red teaming conversational AI models and agents to identify vulnerabilities, unsafe behaviors, bias, misinformation risks, and adversarial weaknesses. The role involves designing and executing structured adversarial tests including jailbreaks, prompt injections, misuse cases, bias exploitation, and multi-turn manipulation. Experts will generate high-quality human evaluation data, classify vulnerabilities, document reproducible attack cases, and provide actionable findings that improve AI safety and robustness. Native-level fluency in both English and Finnish is required.
AI Red Teaming, Prompt Injection, Jailbreak Testing, AI Safety Evaluation, English & Finnish