360发布报告详解AI失控风险 呼吁建立AI安全测评“质检线”
近日,360 AI安全实验室正式发布《大模型安全测评体系与实践报告(2026)》。报告警示,步入“数字员工”时代的大模型面临严峻的AI失控风险:风险已经跳出单纯文本输出错误的范畴,一旦出现敏感信息泄露、越权调用工具、错误执行业务流程等行为,将直接带来实质性损失。360 AI安全专家强调,大模型安全测评是遏制AI失控的关键,正在成为人工智能规模化落地的安全基础设施。

报告指出,国内大模型产业高速迭代,大模型安全风险贯穿数据准备、训练推理、集成部署、应用运行、持续演进的完整全生命周期,各环节风险会沿链路传递、持续放大,最终演变为真实安全事件。一方面,模型可能被恶意诱导突破安全限制,输出有害内容或泄露用户隐私;另一方面,当模型连接知识库、数据库和业务工具后,一次错误判断就可能触发真实业务操作,造成难以挽回的损失。近期,Anthropic、OpenAI、xAI、谷歌DeepMind等多个前沿模型在安全测试中出现突破隔离环境、接触真实系统的情况,再次为行业敲响警钟。
360 AI安全专家强调,AI失控风险客观存在,仅依靠模型自身能力无法完全规避安全隐患。所以大模型安全测评不能只看模型 “聪不聪明”,还要聚焦数据来源合规性、权限边界抗诱导能力、异常事件的阻断与溯源能力。在测评方法上,不能用一套题考所有模型,金融、医疗、政务等不同场景的风险差别很大,应该按场景和风险等级用不同标准。在治理机制上,测完了不等于一劳永逸,模型版本、知识库、提示词和外部工具都在不断变化,测评必须形成"发现问题—整改加固—复测验证—持续监测"的循环。
作为较早布局AI安全的企业,360以“以模治模”理念构建了覆盖大模型与智能体的全栈能力体系。大模型安全方面,360提供安全检测、内容防护、攻防验证、幻觉治理等能力,保障大模型安全、向善、可信、可控。智能体安全方面,360通过智能体全流程管控体系,实现“事前可见可评、事中可判可控、事后可溯可审”的全链路防护。在大模型安全测评方面,360大模型卫士围绕模型的输入输出搭建多层防护,可对大模型上线前当"考官"查风险,运行中当"门卫"拦攻击。据了解,该产品在近期国家级AI安全能力相关测试中获得大模型安全护栏能力第一名。
业内认为,随着我国生成式AI相关法律法规、国家标准不断完善,以及《人工智能安全治理框架》3.0等顶层指引落地,大模型安全测评正在成为人工智能产业的"质检线",谁率先建立起可落地的测评体系、具备成熟AI安全落地实践,谁就能在人工智能规模化应用中占据主动。
