2025年6月,国内人工智能领域的安全场景专项集中测试陆续公布完整结果。不同于过去侧重通用能力跑分的公开榜单,本次测试完全围绕政企安全运维、流量分析、攻防响应等真实业务场景设计指标,彻底跳出了过去“唯参数规模论”的评测误区,实打实摸清楚了不同AI方案在生产环境下的能力边界、可靠性阈值和落地适配要求,为行业接下来大规模推广AI安全应用提供了最具参考价值的实测依据。
本次专项测试的核心背景:从纸面跑分转向实战验证
过去两年里大模型的通用能力榜单层出不穷,但很多企业把高跑分的通用大模型接入实际业务场景后,才发现效果和宣传指标存在巨大落差。尤其是网络安全这类对准确率、响应延迟、数据合规性有极高要求的场景,通用大模型经常出现事实幻觉、推理延迟超标、敏感数据泄露等严重问题,很多试点项目投入大量资源后只能沦为演示性功能,无法真正融入日常运维流程。
正是为了解决“跑分好看但落地无用”的行业痛点,2025年6月由多家网络安全主管单位联合发起的AI安全场景专项测试正式完成全部测试环节,本次测试没有设置任何通用知识问答类的无效题目,所有测试用例全部来自近一年真实发生的攻防事件、安全运维日常工单和企业生产环境的实际流量样本,测试结果直接反映不同AI方案在真实生产场景下的可用程度,完全具备指导后续建设的参考价值。
核心测试结果与关键发现
本次测试覆盖了17款不同厂商提交的AI模型,包含通用大模型垂直微调版本、安全领域专属训练的小参数模型、多模态安全分析模型等多种技术路线,最终得出的几项核心测试结果,直接刷新了行业此前的很多固有认知。
第一个反常识的结论是,千亿参数级别的通用大模型,在安全场景的综合表现反而不如100亿参数级别的垂直微调专属模型。通用大模型虽然在通用知识问答环节拿到了92分的高分,但在实际攻防分析场景中频繁出现幻觉,32%的攻击溯源推理结果存在事实错误,比如把正常的运维远程访问误判为黑客入侵,甚至生成完全不存在的攻击IP地址,完全无法直接用于生产环境。而基于安全领域全量攻防数据集专项训练的100亿参数级专属模型,攻击事件判定准确率达到了94.7%,幻觉占比被控制在2%以下,完全满足日常安全运维的实用要求,同时推理成本仅为千亿级大模型的七分之一,每秒支持的并发分析任务数量高出4倍,性价比优势极其明显。
第二项核心测试结果是,AI处理加密流量分析的能力取得了突破性进展。此前行业普遍认为AI无法在不解密的前提下识别加密流量里的恶意行为,但本次测试中表现最优的3款模型,无需对SM4、AES等加密流量做解密操作,仅基于报文长度分布、交互时间间隔、流量序列特征,就实现了针对加密挖矿、加密C2隧道流量91%以上的识别准确率,误报率低于3%,彻底解决了过去全量加密后安全运维完全失明的痛点,这项实测结果让很多此前不敢大规模推进加密改造的政企用户彻底放下了顾虑。
第三项关键测试结论是,本地部署的私有AI模型在响应速度上完全达到了实时安全运维的要求。参与测试的私有部署模型在100Gbps级别的流量分析压力下,单包特征推理延迟全部控制在2毫秒以内,完全不会出现通用大模型常有的排队等待、超时响应问题,完全可以嵌入现有流量分析设备的处理链路中,不会对原有业务转发性能造成任何额外负担。同时所有测试模型的本地数据隔离能力全部达标,不会主动上传任何原始业务敏感数据,完全满足关键信息基础设施的数据合规要求。
测试暴露的现存短板与行业共识
这次全面测试也发现了当前AI安全应用依然存在的不少待补短板,行业已经形成明确共识。目前多数模型对非常小众的工业协议、行业私有协议的分析能力依然不足,针对这类场景的异常识别准确率还不到70%,接下来需要联合工业、能源等垂直行业的单位,补充大量私有协议的样本数据集完成定向优化,才能满足细分场景的落地要求。
同时AI模型的可解释性依然是明显短板,不少AI模型能够精准识别出异常攻击行为,但无法像传统规则一样给出非常清晰可追溯的判定依据,安全分析师很难直接基于AI的结论完成后续的合规溯源和上报流程,接下来可解释AI框架的优化将会成为下一阶段的核心迭代方向,让AI的每一次告警都能输出完整可追溯的判定链条。
测试后行业落地的新走向