与甄知Service AI 共同探索企业效率提升路径|了解详情
电话: 400-800-2077

首页 > 新闻中心 > 行业动态 > GPT-6 Astra发布!新一轮大模型升级,企业ITSM正在发生什么变化?

GPT-6 Astra发布!新一轮大模型升级,企业ITSM正在发生什么变化?

2026.09.09 来源:



新一轮大模型升级 


近两月,大模型市场迎来一轮密集更新。


OpenAI发布GPT-6 Astra,Google推出Gemini 3.8 Flash及其网络安全版本,Anthropic发布Claude Fable 5.1和Mythos 5.1。

国内厂商方面,DeepSeek更新V4系列,通义千问发布Qwen 3.8-Max与Qwen 3.8-Flash-Next。


如果只看参数规模和评测分数,很难判断这些发布对企业意味着什么。企业更需要关注模型能否稳定完成复杂任务、能否连接现有系统、能否控制执行风险,以及投入成本是否合理。



从以上角度观察,新一轮大模型已经出现清晰的共同方向,而这些变化也将直接影响IT服务管理的流程、架构和治理方式。




大模型升级在哪里?

Part.1



GPT-6 Astra:强化复杂任务的端到端执行

OpenAI于9月3日发布的GPT-6 Astra,定位为面向高难度端到端工作的旗舰模型。


根据官方OpenAI文档,GPT-6 Astra拥有105万Token上下文窗口,最大输出长度为12.8万Token,支持复杂推理、代码开发、研究、文档生成和计算机操作。通过Responses API,还可以使用网页搜索、文件搜索、代码解释器、托管Shell、Computer Use和MCP等工具。


这些能力组合在一起,意味着模型可以在较长时间内读取大量材料,制定执行计划,调用多个工具,并根据执行结果调整后续操作。


Gemini 3.8 Flash:兼顾Agent能力、速度与成本

Google于9月2日发布Gemini 3.8 Flash和Gemini 3.8 Flash Cyber。


  • Gemini 3.8 Flash重点提升软件工程、多步骤推理和Agent任务能力,保持Flash系列相对较低的调用成本。

  • Gemini 3.8 Flash Cyber则面向漏洞发现与自动补丁,通过受控项目向政府机构、关键基础设施运营方和软件维护者提供。


Google的产品路线体现出两个方向

  • 一是让较强的Agent能力进入高频业务场景;

  • 二是针对网络安全等专业领域设置独立模型和访问机制。


Claude Fable 5.1:长周期任务和企业安全

Anthropic于9月1日发布Claude Fable 5.1和Claude Mythos 5.1。两者使用相同的基础模型,但采用不同的安全控制方式


Fable 5.1面向编码、知识工作和长时间运行任务。Mythos 5.1主要服务于网络安全、生命科学等需要严格准入的专业场景。


在Anthropic披露的企业测试中,Fable 5.1被用于复杂生产事故分析、跨代码库依赖梳理和长时间无人值守任务。


国产模型:补齐Agent、多模态与私有化能力

上月,DeepSeek发布V4-Pro正式版,重点加强Agent任务和分级推理,并支持OpenAI Responses API。

8月21日推出的V4-Flash-Vision-Exp增加了图像输入、Files API和多模态工具调用能力。


同月,通义千问发布的Qwen 3.8-Max,强化编码和协同办公能力;发布的Qwen 3.8-Flash-Next,采用多模态混合专家架构,并预览Qwen4的部分技术方向。


综合来看,各家模型的重点有所不同,但升级方向较为一致更长的任务周期、更丰富的工具调用、更完整的多模态输入,以及更严格的安全和成本控制。




从发布潮中看到的技术趋势

Part.2


1

模型评估

传统评测多以知识问答、数学推理和代码生成准确率为主。进入Agent应用阶段后,单次答案正确无法代表模型能够完成完整业务任务。


企业需要增加新的评估指标,包括端到端任务成功率、工具调用准确率、失败恢复能力、人工接管率、执行时间和单位任务成本。


例如,一个模型可能准确判断出故障原因,却没有选择正确的处理工具;也可能完成了配置修改,却未验证服务是否恢复。

这些情况在传统评测中不易体现,却会直接影响生产环境。



2

Computer Use与MCP

Computer Use允许模型浏览、操作浏览器和桌面界面。MCP(模型上下文协议)则用于连接数据源、工具和业务系统。



两者解决的问题不同。Computer Use适合缺少标准接口的系统,API和MCP更适合结构化、可审计的系统调用。企业实际建设中,应优先采用稳定接口,将界面操作作为补充方案。


模型接入ITSM、监控、CMDB、自动化运维和知识平台后,才能从生成建议扩展到执行任务。


3

模型双轨发展

通用模型覆盖多类复杂任务,另有专业版本则针对安全、科研等高风险场景提供专门能力与访问限制。


企业模型架构会逐步采用分层调用

  • 简单任务使用轻量模型

  • 复杂分析使用旗舰模型

  • 专业任务使用领域模型

  • 敏感任务使用私有化模型……


这种方式能够兼顾效果、成本和数据安全,也可以降低对单一供应商的依赖。


4

真实运维流程

IT运维中存在大量非结构化信息,例如监控截图、网络拓扑、设备照片、报错页面、会议录音和操作视频。


多模态模型可以将这些材料与工单、日志和资产信息结合分析。用户只提交一张报错截图时,服务台可以识别错误代码、应用名称和页面状态;现场人员上传设备照片时,系统可以辅助识别告警灯、接口状态和设备型号。


多模态能力提升了信息采集效率,但关键结论仍需结合配置数据和实时状态验证。



5

安全、成本和可治理性

模型能够调用工具后,错误输出可能转化为真实系统操作。企业必须管理Agent身份、访问范围、审批节点、操作留痕和异常回退。


成本治理同样重要。长上下文、多轮推理和反复调用工具都会增加费用。企业需要按任务类型设置模型、推理强度和最大执行步数,并对单次任务成本建立监控。


模型能力越强,权限边界和审计要求也越具体。




ITSM正在发生四个变化

Part.3


变化一:服务台升级

当前许多AI服务台主要用于回答常见问题、推荐知识和生成工单摘要。新一代Agent可以读取用户身份、设备信息和历史记录,并调用系统完成标准化操作


以账号解锁为例,Agent可以核验用户身份,查询账号状态,判断是否符合自助处理条件,调用目录服务执行解锁,再检查登录状态并更新工单。


服务台指标也有相应调整,如回答准确率、一次解决率、自动闭环率、人工接管率和平均解决时间。


变化二:事件管理

发生生产故障后,运维人员通常需要在监控、日志、链路追踪、CMDB和变更系统之间反复查询。


Agent可以根据事件时间和受影响服务,操作完整流程,包括信息收集、原因分析、方案生成、操作执行、恢复验证和记录回写。对明确、低风险且具备回退条件的操作,可以在审批后执行。


需注意:任何环节缺少验证,都不能视为事件闭环。


变化三:问题与变更管理

问题管理需要从大量历史事件中识别重复模式。模型可以跨工单分析共同组件、相似日志和变更记录,帮助发现长期存在但未被单独事件暴露的系统问题。


在变更管理中,Agent可以综合CMDB依赖、历史变更结果、当前告警、测试报告和业务时段,生成影响范围、风险等级、验证计划和回退方案。


变化四:Agent治理

当AI参与服务交付,ITSM平台需要管理新的执行主体。


平台应明确每个Agent能够读取哪些数据、调用哪些工具、处理哪些服务目录,以及在哪些节点必须转交人工,并配置更严格的审批规则

同时,每次模型判断、工具调用、参数输入、执行结果和人工干预都应保留记录,沉淀智能资产


在这一体系中,大模型提供理解、推理和执行能力,ITSM提供流程、权限、责任和审计机制。两者结合后,企业才可能建立可控的自动化闭环。



GPT-6 Astra、Gemini 3.8和同期模型的升级,对ITSM而言,短期变化将集中在知识检索、工单处理、事件调查和变更分析。随着工具连接、数据质量和治理机制逐步完善,部分标准化、低风险服务可以实现自动闭环。


模型决定可实现的能力范围,而ITSM则决定这些能力能否以可控、可审计的方式进入企业生产流程。




标签:
推荐新闻
选择甄知科技 加速企业数智化升级