← All papers
Paper 004·AI Safety·February 2026

Manifold of Failure: Behavioral Attraction Basins in Language Models

S. Munshi, M. Bhatt, V. S. Narajala, I. Habler, A. Al-Kahfah, K. Huang, B. Gatto

Open paper

Abstract

Maps unsafe behavioral regions in language models as attraction basins, using quality-diversity search to expose distinct vulnerability niches and their geometry.

Research record

This page summarizes the public research record and links to the authoritative paper source. Propose a replication or report a discrepancy to b1oo@shrewdsecurity.io.