How Could AI Eliminate Humanity? A Failure-Mode Analysis of Civilizational Risk
This study addresses whether existential or civilization-collapse risks posed by advanced artificial intelligence necessarily depend on consciousness and malice. To investigate this, the project constructs a systematic failure-mode assessment framework that integrates causal conditional analysis with intermediate-variable quantification to identify non-conscious risk interaction pathways, such as autonomous misalignment and malicious use. The work demonstrates that catastrophic risks do not require consciousness as a prerequisite. It establishes a multidimensional risk taxonomy encompassing capabilities and autonomy, elucidates the mechanisms through which these dimensions influence risk severity, and proposes a research agenda for non-operationalizable defense strategies. Collectively, these contributions provide novel theoretical foundations for AI safety governance.