AI & ML interests
Safe and aligned AI research. We research situational awareness, deception, and hidden reasoning in language models.
truthful-ai 's datasets
None public yet
Safe and aligned AI research. We research situational awareness, deception, and hidden reasoning in language models.