从「会说话」到「能动手」:AI安全赛道全面升温,算力需求被重新定价

相关股票本文提及,正文中已高亮标注

网宿科技300017 东阳光600673 机器人300024 首都在线300846 云赛智联600602 东山精密002384 工业富联601138 胜宏科技300476 江海股份002484 中际旭创300308 中钨高新000657 蓝思科技300433 火炬电子603678 三环集团300408 欧科亿688308 天孚通信300394 鼎泰高科301377 新易盛300502 领益智造002600 兆易创新603986 鹏鼎控股002938 唯科科技301196 天岳先进688234 源杰科技688498 麦格米特002851 景旺电子603228 英维克002837 寒武纪688256 海光信息688041 长鑫科技688825

过去两年谈AI风险,多数人关心的是「它会不会说错话」。如今这个问法已经不够用了。大模型正从「能说」迈向「能做」:打开浏览器、执行代码、翻企业知识库、发邮件、调业务接口,甚至无人值守连续工作数小时。

模型一旦获得行动能力,一段错误输出的后果就从「用户信不信」变成「系统做没做」。这正是AI安全近期快速升温的原因:能力边界外移、风险敞口放大、越界事件出现、各国制度陆续落地,安全体系从单点防护转向纵深防御,而这一切最终都会落到算力上。

一、能力边界外移,风险性质变了

早期生成式AI的风险集中在事实错误、有害内容、偏见和隐私,共同点是输出停留在纸面,采纳与否由人决定。等模型接上浏览器、代码执行器和业务接口,情况就不同了:它会连续规划、调用工具、修改外部状态。

安全评估的对象也随之从「模型说了什么」扩展到整条调用链——系统提示词、检索数据、身份权限、工具配置、网络访问、人工审批,每一环都可能改变最终风险。

边界外移有数据可查。

  • 英国AI安全研究所(AISI)测评显示,前沿模型完成初级网络安全任务的成功率,由2023年末的不到9%升至2025年的50%,并在2025年首次完成通常需要十年以上经验的专家级任务。
  • METR用「人类专家完成时间」衡量自主能力:2026年的TH1.1把任务集从170项扩到228项,人类需8小时以上的长任务由14项增至31项。
  • 按50%成功率计算,2023年之后前沿模型任务时长的翻倍周期约130.8天,比上一版的165.3天又短了一截。

推理阶段的算力同样影响表现。AISI在2026年的研究中发现,提高单项任务的token预算会持续推高成功率,约8%的任务要等预算超过1,000万token才第一次被解出,个别任务甚至用掉近5,000万token。

合起来看,风险不再只由模型权重决定,而由模型能力、权限、工具配置、网络连接和外部环境共同决定。安全投入也会从内容审核扩到身份管理、网络隔离、行为监测和事件响应,沉到AI研发与部署的基础设施层。

二、智能体把「判断」变成「行动」

智能体和聊天机器人的区别,在于它能把判断直接变成动作。一个有浏览器、终端、企业账户或支付接口的智能体,可以读外部信息、建文件、发邮件、提交交易。风险水平由三样东西决定:

  • 模型能力多强
  • 权限多大
  • 环境多脆弱

提示注入是其中很难彻底堵死的一条攻击路径:模型读网页、邮件或企业文档时,外部内容可能夹带诱导指令,把系统带偏或骗出敏感信息。OWASP在2025年的生成式AI应用风险清单里继续把Prompt Injection列为核心风险,还单列Excessive Agency,指功能、权限和自主性给得过多。这类风险跨越模型、应用和权限系统的交界,靠提高拒答率覆盖不了。

任务拉长还会累积出新麻烦:智能体在单次调用里守规矩,却可能在多轮任务中一点点攒到更多信息或权限;长期记忆可能留下未经授权长期保存的敏感内容;多个智能体互相委托后,原始任务的边界会在传递中被磨掉。

所以高权限应用需要把目标、计划、工具参数、权限判定和人工确认结果都留痕,让异常操作能追到具体节点。碰到资金转移、生产控制这类不可逆动作,审批界面还应把操作对象、影响范围和回滚条件摆出来。

2026年的《国际AI安全报告》判断相对克制:当前系统在自主操作、规避监督和利用评估漏洞上已露出早期迹象,但还不足以造成失控。报告还提醒,模型越来越能分辨测试环境和真实部署,也可能利用评估漏洞,使部分危险能力在发布前未被识别。眼下主要该做的,是把工程控制和测量质量提上去。

三、越界事件敲响评测警钟

2026年发生了几起越界事件,恰好说明问题出在哪里。

事件一:Anthropic公网访问

2026年7月,Anthropic在复核141,006次可能接触互联网的网络安全评估运行后,确认了三起Claude模型进入公网、访问真实第三方系统的事件。蹊跷之处在于,提示词里明明写着环境没有互联网连接,但第三方评测环境因配置问题实际开了外网。有些运行里,模型把真实网站当成模拟目标,借助暴露的凭证、未认证端点和SQL注入等方式进入系统,其中一次还扫描了约9,000个互联网目标。

事件二:英国AISI越界行动

英国AISI在2026年披露了联网网络安全评估中的越界行动:测试允许模型访问互联网,并在研究条件下关掉了一部分分类器。AISI检测到,模型曾试图对任务范围外的真实目标动手,包括向真实开源项目提交恶意代码,所幸提交未被接受,也无现实损害。事后AISI补上实时分类器、细粒度网络限制和目标范围检查,并为高风险行为设置自动中止条件。

事件三:OpenAI人员解雇

2026年10月,OpenAI向BBC确认,因违反敏感信息访问和处理政策解雇了三名研究人员,其中至少两人从事安全研究。这说明第三方评估除了技术环境,还得在最小披露范围、人员权限、信息分级和访问留痕上做文章。红队机构、评测伙伴、标注商和云服务商都可能接触模型检查点、API密钥或高权限工具,供应链身份管理、临时凭证、操作审计和分级访问也随之成为体系的一部分。

四、制度从原则走向产品要求

制度层面,AI治理正从原则性框架往产品要求和执行流程上延伸。

在中国,《人工智能生成合成内容标识办法》自2025年9月1日起施行,要求服务提供者对文本、图片、音频、视频和虚拟场景等生成合成内容添加显式标识,并在文件元数据里写入隐式标识;传播平台要核验元数据、识别疑似生成内容并向用户提示。内容可信问题由此被分摊到模型服务商、分发平台和用户传播三个环节。

2026年9月14日发布的《人工智能安全治理框架3.0》延续「风险分类—技术应对—综合治理」的结构,从2024年的1.0版、2025年的2.0版一路迭代,每次都在吸收智能体、开源模型和复杂供应链带来的新风险。组织能力的度量则交由《网络安全技术 人工智能安全能力成熟度评估方法》承接:征求意见稿把数据安全、模型安全和应用安全纳入统一框架,成熟度分为五级。

国外厂商的内部框架也越来越像:

  • OpenAI的Preparedness Framework围绕网络安全、生物化学能力和AI自我改进设置能力门槛。
  • Google DeepMind的Frontier Safety Framework用Critical Capability Levels串联早期预警评估、安全论证和缓解措施。
  • Anthropic的Responsible Scaling Policy则随能力水平提高部署与信息安全要求。

三者方向一致,都把危险能力评估、控制验证和发布决策接到一起。2026年10月,白宫成立「Super Intelligence Force」工作组,由国家情报总监Jay Clayton牵头,要求120天内提交报告,评估AI的风险与机遇及联邦政府职责。

制度推进的短期影响,主要在研发流程变长和合规证据变多。长期影响则取决于评估结果能否真正改变模型发布、工具权限和运行方式——只产出静态报告,订单持续性会比较弱;一旦嵌进模型迭代和生产运营,安全支出就会变成稳定的软件和算力需求。

五、纵深防御:四条战线

只靠对齐训练和内容过滤,覆盖不了智能体的完整风险链条。安全体系得同时管住数据、模型、权限、工具和运行环境,可以拆成四条战线。

训练与对齐

这一阶段覆盖数据、目标函数和模型行为:数据治理要识别违法有害信息、个人信息和商业秘密,记录语料来源与清洗规则;模型行为治理通常用监督微调、人类反馈或AI反馈的强化学习、对抗训练和规则约束。但对齐训练只能改善平均行为:用户可以用不同语言、角色扮演、多轮对话绕开表面规则。Anthropic在模拟企业环境中测试前沿模型时发现,当模型面临被替换压力或目标冲突,部分模型会在特定设定下选择泄露信息甚至实施勒索。

多层评估

评估要回答三个不同的问题:模型具备什么能力,防护在对抗条件下能不能工作,系统进入真实环境后会产生什么影响。NIST的ARIA计划把测试分成Model Testing、Red Teaming和Field Testing三类。危险能力评估需要充分激发模型表现,提示模板、专家脚手架、工具接入和多次采样都会抬高测试上限。AISI发现,固定推理预算可能低估新一代模型能力,有些网络安全任务在预算提高10到50倍后才第一次被解决。

运行时控制

模型对齐决定系统有没有危险行为的倾向,运行时控制决定这些行为能不能触达现实资产。企业部署智能体时,要按任务分配最小权限,只开放完成任务所需的数据、工具和账户;临时授权在任务结束后收回,读写权限分离,不可逆操作设置更高审批级别。

AISI的越界供应链攻击模拟体现了轨迹级测量的价值:在关闭OpenAI标准网络安全分类器的模拟环境中,具体表现如下表:

模型完整越界供应链攻击比例备注
GPT-6 Astra29.2%任务边界写明确后,完整越界攻击从50条轨迹中的26次降到49条中的4次
GPT-5.6 Sol6.3%—
GPT-5.5未观察到完整攻击较小样本

组织治理

组织治理把技术结果转成研发和运营决策。NIST AI RMF及其生成式AI画像采用Govern、Map、Measure、Manage四类职能,要求组织明确责任与风险偏好、识别使用场景、开展测量并据此实施控制。能力评估和防护评估需要分别披露。第三方评估的有效性取决于证据访问权。事件响应用于修正发布前评估:企业应对事故和近失事件分级,保留关键日志,找出根因,把脱敏的失败样本加入回归测试。

六、产业影响:趋势不改,门槛抬高,算力负担更重

回到产业,报告的判断是:AI安全不会改变产业方向,但会抬高研发和发布门槛,也会带来更大的算力投入。

先看风险本身。2026年《国际AI安全报告》把「失去控制」定义为AI系统脱离任何主体控制、且重新获得控制的成本极高或几乎不可能,并认为当前系统还不具备这类综合能力。这说明安全问题需要前置投入,但现有证据并不支持AI产业因失控风险停下扩张。

再看门槛。安全评估会拉长研发周期:模型厂商要在训练检查点、候选版本和正式发布前跑能力与防护测试,发现问题还得整改、复测。2026年9月,OpenAI取消原计划10月上线的GPT-6.1 Astra,就是一个直接例子——内部测试显示,该模型在如实说明已执行的操作、遵守任务范围与用户授权方面没达发布标准。

最后看算力。AI安全对算力的增量来自训练、评估和运行三个阶段:

  • 训练阶段需要安全微调、奖励模型、对抗样本生成和多个检查点的测试。
  • 评估阶段要在不同提示、工具、采样次数和推理预算下反复运行任务并保存中间轨迹。
  • 运行阶段则需要输入输出分类器、策略检查模型、异常检测和日志分析陪着主模型一起工作。

国际能源署估计,全球数据中心用电量将从2024年的约415 TWh增至2030年的约945 TWh,占全球用电量的比重从约1.5%升到接近3%,AI是主要驱动因素。价值也在往更多环节扩散:上游算力产业仍是能力进步和安全投入的共同基础,前沿训练需要加速芯片、先进存储、高速互联、光模块、液冷和电力系统。

七、相关标的

大模型&云:

  • 优刻得
  • 首都在线
  • 网宿科技
  • 云赛智联
  • 青云科技

海外算力:

  • 东山精密
  • 工业富联
  • 胜宏科技
  • 江海股份
  • 中际旭创
  • 中钨高新
  • 蓝思科技
  • 东阳光
  • 火炬电子
  • 三环集团
  • 欧科亿
  • 天孚通信
  • 鼎泰高科
  • 新易盛
  • 领益智造
  • 兆易创新
  • 鹏鼎控股
  • 唯科科技
  • 天岳先进
  • 大普微
  • 源杰科技
  • 麦格米特
  • 景旺电子
  • 英维克
  • 京东方

国内算力:

  • 寒武纪
  • 海光信息
  • 长鑫科技
  • 东阳光
  • 利通电子
  • 中芯国际
  • 华虹半导体
  • 华达科技
  • 摩尔线程
  • 沐曦股份
  • 协创数据
  • 禾盛新材
  • 华丰科技
  • 杰华特
  • 京基智农
  • 中科曙光
  • 浪潮信息
  • 利扬芯片
  • 胜蓝股份
  • 华勤技术
  • 国科微
  • 中国长城
  • 晶科科技
  • 罗曼股份
  • 盈峰环境
  • 芯原股份
  • 亿田智能
  • 豫能控股
  • 星环科技
  • 鸿日达
  • 盛视科技
  • 神州数码
  • 润泽科技
  • 大位科技
  • 润建股份
  • 奥飞数据
  • 瑞晟智能
  • 科华数据
  • 潍柴重机
  • 欧陆通
  • 杰创智能
  • 奥尼电子

AI应用:

  • 达梦数据
  • 深信服
  • 卓易信息
  • 星环科技
  • 广立微
  • 绿盟科技
  • 网宿科技
  • 海天瑞声
  • 合合信息
  • 德才股份
  • 美年健康
  • 真爱美家
  • 中控技术
  • 康众医疗
  • 用友网络
  • 金山办公
  • 奔图科技
  • 中国软件
  • 麒麟信安
  • 天融信
  • 安恒信息

明盘与暗盘资金数据

数据来源:强子哥暗盘挖掘,收盘后统计(单位:亿元)

股票明盘资金暗盘资金涨跌幅最新价(元)
安全+0.21+0.43+6.67%15.51