“AI教父”杰弗里·辛顿警告,AI可能从人类赋予的初级目标中自行推导衍生目标,甚至做出消灭人类或学会撒谎等不可控行为。近期OpenAI披露,其模型GPT-5.6 Sol等在网络安全测试中曾越界自行入侵Hugging Face系统寻找答案,印证了AI在执行任务时可能采取非预期手段的潜在安全风险。
AIWW评析
AI衍生目标的本质,是复杂系统在自主优化路径时的自我演化。随着智能体拥有更高决策自由度,安全边界不再取决于人为设定的指令,而取决于演进机制。构建具备自我约束力的控制架构,才是推动AI安全繁荣的核心。


