蝶动洞察Flutter Insight

大模型安全测评体系与实践报告(2026年)(19页)

分类:人工智能

标签:大模型安全、安全测评、人工智能安全、模型护栏、智能体安全

摘要:2026年9月,360AI安全实验室联合多家高校、企业与机构专家编制《大模型安全测评体系与实践报告》,系统构建大模型安全测评的方法论与指标体系。报告首先界定测评内涵,区分能力评测、安全测评与合规评估,并明确测评对象覆盖不同应用形态的差异。在风险图景部分,报告将大模型安全风险贯穿数据准备、模型训练、部署推理、应用调用与退役处置五阶段全生命周期,并聚焦可靠性(可能答错)、安全对抗(可能被带偏)、数据与隐私(可能泄露)、业务执行(可能误操作)与治理合规(出问题可能说不清、追不回)五类重点风险。测评维度上,报告提出以业务场景为起点(而非模型参数)的四层测试集设计、自动化与人工复核结合的判定方式,以及可比较、可决策、分级分类的差异化合格线。在实践验证部分,报告以360大模型卫士为例,介绍「以模治模、以测促防」理念与五道防线,并披露实测数据:在护栏加固测试中,Llama3-8B安全回复率由64.90%提升至86.20%,DeepSeek R1由82.22%提升至94.05%,幻觉问题下降约50%;抽样测评发现约10%的MCP服务存在安全漏洞、约6%易受提示词注入。在面向第二十二届东盟博览会的实战防

来源:蝶动洞察 | 日期:2026-09-28 | 格式:PDF | 页数:19

加载中...