Paper 004·AI Safety·February 2026
Manifold of Failure: Behavioral Attraction Basins in Language Models
S. Munshi, M. Bhatt, V. S. Narajala, I. Habler, A. Al-Kahfah, K. Huang, B. Gatto
↗ Open paperAbstract
Maps unsafe behavioral regions in language models as attraction basins, using quality-diversity search to expose distinct vulnerability niches and their geometry.
Research record
This page summarizes the public research record and links to the authoritative paper source. Propose a replication or report a discrepancy to b1oo@shrewdsecurity.io.