AI.info
Usman Naseem
Explore Usman Naseem on AI.info.
- Beyond Shallow Alignment: How Post-Training Methods Determine Refusal Circuits And Steering Robustness
- From Native Memes to Global Moderation: Cross-Cultural Evaluation of Vision-Language Models for Hateful Meme Detection
- Health-ORSC-Bench: A Benchmark for Measuring Over-Refusal and Safety Completion in Health Context