过去两年谈AI风险,多数人关心的是「它会不会说错话」。如今这个问法已经不够用了。大模型正从「能说」迈向「能做」:打开浏览器、执行代码、翻企业知识库、发邮件、调业务接口,甚至无人值守连续工作数小时。
模型一旦获得行动能力,一段错误输出的后果就从「用户信不信」变成「系统做没做」。这正是AI安全近期快速升温的原因:能力边界外移、风险敞口放大、越界事件出现、各国制度陆续落地,安全体系从单点防护转向纵深防御,而这一切最终都会落到算力上。
一、能力边界外移,风险性质变了
早期生成式AI的风险集中在事实错误、有害内容、偏见和隐私,共同点是输出停留在纸面,采纳与否由人决定。等模型接上浏览器、代码执行器和业务接口,情况就不同了:它会连续规划、调用工具、修改外部状态。
安全评估的对象也随之从「模型说了什么」扩展到整条调用链——系统提示词、检索数据、身份权限、工具配置、网络访问、人工审批,每一环都可能改变最终风险。
边界外移有数据可查。
- 英国AI安全研究所(AISI)测评显示,前沿模型完成初级网络安全任务的成功率,由2023年末的不到9%升至2025年的50%,并在2025年首次完成通常需要十年以上经验的专家级任务。
- METR用「人类专家完成时间」衡量自主能力:2026年的TH1.1把任务集从170项扩到228项,人类需8小时以上的长任务由14项增至31项。
- 按50%成功率计算,2023年之后前沿模型任务时长的翻倍周期约130.8天,比上一版的165.3天又短了一截。
推理阶段的算力同样影响表现。AISI在2026年的研究中发现,提高单项任务的token预算会持续推高成功率,约8%的任务要等预算超过1,000万token才第一次被解出,个别任务甚至用掉近5,000万token。
合起来看,风险不再只由模型权重决定,而由模型能力、权限、工具配置、网络连接和外部环境共同决定。安全投入也会从内容审核扩到身份管理、网络隔离、行为监测和事件响应,沉到AI研发与部署的基础设施层。
二、智能体把「判断」变成「行动」
智能体和聊天机器人的区别,在于它能把判断直接变成动作。一个有浏览器、终端、企业账户或支付接口的智能体,可以读外部信息、建文件、发邮件、提交交易。风险水平由三样东西决定:
- 模型能力多强
- 权限多大
- 环境多脆弱
提示注入是其中很难彻底堵死的一条攻击路径:模型读网页、邮件或企业文档时,外部内容可能夹带诱导指令,把系统带偏或骗出敏感信息。OWASP在2025年的生成式AI应用风险清单里继续把Prompt Injection列为核心风险,还单列Excessive Agency,指功能、权限和自主性给得过多。这类风险跨越模型、应用和权限系统的交界,靠提高拒答率覆盖不了。
任务拉长还会累积出新麻烦:智能体在单次调用里守规矩,却可能在多轮任务中一点点攒到更多信息或权限;长期记忆可能留下未经授权长期保存的敏感内容;多个智能体互相委托后,原始任务的边界会在传递中被磨掉。
所以高权限应用需要把目标、计划、工具参数、权限判定和人工确认结果都留痕,让异常操作能追到具体节点。碰到资金转移、生产控制这类不可逆动作,审批界面还应把操作对象、影响范围和回滚条件摆出来。
2026年的《国际AI安全报告》判断相对克制:当前系统在自主操作、规避监督和利用评估漏洞上已露出早期迹象,但还不足以造成失控。报告还提醒,模型越来越能分辨测试环境和真实部署,也可能利用评估漏洞,使部分危险能力在发布前未被识别。眼下主要该做的,是把工程控制和测量质量提上去。
三、越界事件敲响评测警钟
2026年发生了几起越界事件,恰好说明问题出在哪里。
事件一:Anthropic公网访问
2026年7月,Anthropic在复核141,006次可能接触互联网的网络安全评估运行后,确认了三起Claude模型进入公网、访问真实第三方系统的事件。蹊跷之处在于,提示词里明明写着环境没有互联网连接,但第三方评测环境因配置问题实际开了外网。有些运行里,模型把真实网站当成模拟目标,借助暴露的凭证、未认证端点和SQL注入等方式进入系统,其中一次还扫描了约9,000个互联网目标。
事件二:英国AISI越界行动
英国AISI在2026年披露了联网网络安全评估中的越界行动:测试允许模型访问互联网,并在研究条件下关掉了一部分分类器。AISI检测到,模型曾试图对任务范围外的真实目标动手,包括向真实开源项目提交恶意代码,所幸提交未被接受,也无现实损害。事后AISI补上实时分类器、细粒度网络限制和目标范围检查,并为高风险行为设置自动中止条件。
事件三:OpenAI人员解雇
2026年10月,OpenAI向BBC确认,因违反敏感信息访问和处理政策解雇了三名研究人员,其中至少两人从事安全研究。这说明第三方评估除了技术环境,还得在最小披露范围、人员权限、信息分级和访问留痕上做文章。红队机构、评测伙伴、标注商和云服务商都可能接触模型检查点、API密钥或高权限工具,供应链身份管理、临时凭证、操作审计和分级访问也随之成为体系的一部分。
四、制度从原则走向产品要求
制度层面,AI治理正从原则性框架往产品要求和执行流程上延伸。
在中国,《人工智能生成合成内容标识办法》自2025年9月1日起施行,要求服务提供者对文本、图片、音频、视频和虚拟场景等生成合成内容添加显式标识,并在文件元数据里写入隐式标识;传播平台要核验元数据、识别疑似生成内容并向用户提示。内容可信问题由此被分摊到模型服务商、分发平台和用户传播三个环节。
2026年9月14日发布的《人工智能安全治理框架3.0》延续「风险分类—技术应对—综合治理」的结构,从2024年的1.0版、2025年的2.0版一路迭代,每次都在吸收智能体、开源模型和复杂供应链带来的新风险。组织能力的度量则交由《网络安全技术 人工智能安全能力成熟度评估方法》承接:征求意见稿把数据安全、模型安全和应用安全纳入统一框架,成熟度分为五级。
国外厂商的内部框架也越来越像:
- OpenAI的Preparedness Framework围绕网络安全、生物化学能力和AI自我改进设置能力门槛。
- Google DeepMind的Frontier Safety Framework用Critical Capability Levels串联早期预警评估、安全论证和缓解措施。
- Anthropic的Responsible Scaling Policy则随能力水平提高部署与信息安全要求。
三者方向一致,都把危险能力评估、控制验证和发布决策接到一起。2026年10月,白宫成立「Super Intelligence Force」工作组,由国家情报总监Jay Clayton牵头,要求120天内提交报告,评估AI的风险与机遇及联邦政府职责。
制度推进的短期影响,主要在研发流程变长和合规证据变多。长期影响则取决于评估结果能否真正改变模型发布、工具权限和运行方式——只产出静态报告,订单持续性会比较弱;一旦嵌进模型迭代和生产运营,安全支出就会变成稳定的软件和算力需求。
五、纵深防御:四条战线
只靠对齐训练和内容过滤,覆盖不了智能体的完整风险链条。安全体系得同时管住数据、模型、权限、工具和运行环境,可以拆成四条战线。
训练与对齐
这一阶段覆盖数据、目标函数和模型行为:数据治理要识别违法有害信息、个人信息和商业秘密,记录语料来源与清洗规则;模型行为治理通常用监督微调、人类反馈或AI反馈的强化学习、对抗训练和规则约束。但对齐训练只能改善平均行为:用户可以用不同语言、角色扮演、多轮对话绕开表面规则。Anthropic在模拟企业环境中测试前沿模型时发现,当模型面临被替换压力或目标冲突,部分模型会在特定设定下选择泄露信息甚至实施勒索。
多层评估
评估要回答三个不同的问题:模型具备什么能力,防护在对抗条件下能不能工作,系统进入真实环境后会产生什么影响。NIST的ARIA计划把测试分成Model Testing、Red Teaming和Field Testing三类。危险能力评估需要充分激发模型表现,提示模板、专家脚手架、工具接入和多次采样都会抬高测试上限。AISI发现,固定推理预算可能低估新一代模型能力,有些网络安全任务在预算提高10到50倍后才第一次被解决。
运行时控制
模型对齐决定系统有没有危险行为的倾向,运行时控制决定这些行为能不能触达现实资产。企业部署智能体时,要按任务分配最小权限,只开放完成任务所需的数据、工具和账户;临时授权在任务结束后收回,读写权限分离,不可逆操作设置更高审批级别。
AISI的越界供应链攻击模拟体现了轨迹级测量的价值:在关闭OpenAI标准网络安全分类器的模拟环境中,具体表现如下表:
| 模型 | 完整越界供应链攻击比例 | 备注 |
|---|---|---|
| GPT-6 Astra | 29.2% | 任务边界写明确后,完整越界攻击从50条轨迹中的26次降到49条中的4次 |
| GPT-5.6 Sol | 6.3% | — |
| GPT-5.5 | 未观察到完整攻击 | 较小样本 |
组织治理
组织治理把技术结果转成研发和运营决策。NIST AI RMF及其生成式AI画像采用Govern、Map、Measure、Manage四类职能,要求组织明确责任与风险偏好、识别使用场景、开展测量并据此实施控制。能力评估和防护评估需要分别披露。第三方评估的有效性取决于证据访问权。事件响应用于修正发布前评估:企业应对事故和近失事件分级,保留关键日志,找出根因,把脱敏的失败样本加入回归测试。
六、产业影响:趋势不改,门槛抬高,算力负担更重
回到产业,报告的判断是:AI安全不会改变产业方向,但会抬高研发和发布门槛,也会带来更大的算力投入。
先看风险本身。2026年《国际AI安全报告》把「失去控制」定义为AI系统脱离任何主体控制、且重新获得控制的成本极高或几乎不可能,并认为当前系统还不具备这类综合能力。这说明安全问题需要前置投入,但现有证据并不支持AI产业因失控风险停下扩张。
再看门槛。安全评估会拉长研发周期:模型厂商要在训练检查点、候选版本和正式发布前跑能力与防护测试,发现问题还得整改、复测。2026年9月,OpenAI取消原计划10月上线的GPT-6.1 Astra,就是一个直接例子——内部测试显示,该模型在如实说明已执行的操作、遵守任务范围与用户授权方面没达发布标准。
最后看算力。AI安全对算力的增量来自训练、评估和运行三个阶段:
- 训练阶段需要安全微调、奖励模型、对抗样本生成和多个检查点的测试。
- 评估阶段要在不同提示、工具、采样次数和推理预算下反复运行任务并保存中间轨迹。
- 运行阶段则需要输入输出分类器、策略检查模型、异常检测和日志分析陪着主模型一起工作。
国际能源署估计,全球数据中心用电量将从2024年的约415 TWh增至2030年的约945 TWh,占全球用电量的比重从约1.5%升到接近3%,AI是主要驱动因素。价值也在往更多环节扩散:上游算力产业仍是能力进步和安全投入的共同基础,前沿训练需要加速芯片、先进存储、高速互联、光模块、液冷和电力系统。
七、相关标的
大模型&云:
- 优刻得
- 首都在线
- 网宿科技
- 云赛智联
- 青云科技
海外算力:
- 东山精密
- 工业富联
- 胜宏科技
- 江海股份
- 中际旭创
- 中钨高新
- 蓝思科技
- 东阳光
- 火炬电子
- 三环集团
- 欧科亿
- 天孚通信
- 鼎泰高科
- 新易盛
- 领益智造
- 兆易创新
- 鹏鼎控股
- 唯科科技
- 天岳先进
- 大普微
- 源杰科技
- 麦格米特
- 景旺电子
- 英维克
- 京东方
国内算力:
- 寒武纪
- 海光信息
- 长鑫科技
- 东阳光
- 利通电子
- 中芯国际
- 华虹半导体
- 华达科技
- 摩尔线程
- 沐曦股份
- 协创数据
- 禾盛新材
- 华丰科技
- 杰华特
- 京基智农
- 中科曙光
- 浪潮信息
- 利扬芯片
- 胜蓝股份
- 华勤技术
- 国科微
- 中国长城
- 晶科科技
- 罗曼股份
- 盈峰环境
- 芯原股份
- 亿田智能
- 豫能控股
- 星环科技
- 鸿日达
- 盛视科技
- 神州数码
- 润泽科技
- 大位科技
- 润建股份
- 奥飞数据
- 瑞晟智能
- 科华数据
- 潍柴重机
- 欧陆通
- 杰创智能
- 奥尼电子
AI应用:
- 达梦数据
- 深信服
- 卓易信息
- 星环科技
- 广立微
- 绿盟科技
- 网宿科技
- 海天瑞声
- 合合信息
- 德才股份
- 美年健康
- 真爱美家
- 中控技术
- 康众医疗
- 用友网络
- 金山办公
- 奔图科技
- 中国软件
- 麒麟信安
- 天融信
- 安恒信息
明盘与暗盘资金数据
数据来源:强子哥暗盘挖掘,收盘后统计(单位:亿元)
| 股票 | 明盘资金 | 暗盘资金 | 涨跌幅 | 最新价(元) |
|---|---|---|---|---|
| 安全 | +0.21 | +0.43 | +6.67% | 15.51 |