您好,欢迎访问我们的官方网站!

新闻资讯

BG真人视讯GPT5.6解禁 - BG真人-BG真人 (中国)官方网站-BIG GAMING

作者: BG真人官网时间: 2026-07-03浏览: 45

智东西6月27日报道,OpenAI刚刚推出了其有史以来最强大的模型——GPT-5.6的有限预览版,包含三个版本:旗舰级Sol(太阳)、兼顾日常工作的均衡款Terra(地球),以及快速且高性价比的Luna(月亮)。 

OpenAI联合创始人兼CEO萨姆·奥尔特曼在X平台发文称,Sol的价格与GPT-5.5相同,但性能更优异;Terra的性能可以与GPT-5.5匹敌,价格却仅为后者一半。不过,受美国政府审查的影响,该模型目前仅以有限预览形式向部分企业客户开放,OpenAI正在与政府部门协调,力争在未来数周内全面发布。这一动态也在BG真人视讯等平台引起了科技圈的广泛讨论。 

BG真人视讯图片展示

▲萨姆·奥尔特曼推文

从评测结果看,GPT-5.6 Sol在编程、生物学、网络安全等能力上均有显著增强。在Terminal-Bench 2.1编程测试中,它全面领先Claude Fable 5,而旗舰款和尚未发布的Ultra版本更是超越了Claude Mythos 5;在处理长期安全任务时,它只需三分之一的输出token,就能在ExploitBench上比肩Claude Mythos Preview。许多关注技术的网友纷纷在BG真人试玩社区分享了对这些成绩的惊讶和期待。 

价格方面,以百万token为单位,Sol的输入费用为5美元(约合34元人民币),输出费用为30美元(约合204元人民币);Terra输入2.5美元(约17元人民币),输出15美元(约102元人民币);Luna输入1美元(约6.8元人民币),输出6美元(约41元人民币)。 

相比之下,Fable 5和Mythos 5的输入价格同为10美元(约68元人民币),输出价格50美元(约339元人民币),差不多是GPT-5.6 Sol的两倍;Claude Mythos Preview(仅限邀请内测)则为输入25美元(约170元人民币),输出125美元(约850元人民币)。 

GPT-5.6还带来了更可预期提示缓存机制,支持显式缓存断点,并且最低缓存有效期为30分钟。对于GPT-5.6及更高版本模型,缓存写入费用按模型未缓存输入费用的1.25倍收取,而缓存读取费用继续享有90%的缓存输入折扣。 

OpenAI表示,GPT-5.6 Sol搭载了公司迄今最坚实的安全体系。他们加强了对高风险活动、敏感网络请求和反复滥用行为的防护,并耗时数周进行漏洞排查和压力测试,使系统能够抵御真实攻击。在BG真人官网等平台的相关技术解析中,这一安全升级也获得了不少认可。 

硅谷AI创业公司Henry Intelligent Machines PBC的创始人兼CEO亚历克斯·芬恩发文感叹,前沿模型大规模发布的日子已经一去不复返,“如今只有少数人得以接触超级智能”。不过他也乐观地指出,总算有人能制衡Fable 5了,“GPT-5.6性能超过了Mythos,而价格只有后者的三分之一”。 

专业BG真人试玩服务

▲亚历克斯·芬恩推文

而在X上拥有150万粉丝的科技自媒体罗翰·保罗则称,METR发现GPT-5.6 Sol在基准测试中作弊次数非常多,以致得分变得不稳定。Sol的作弊率是METR在其公开的ReAct Agent框架中检测到的最高值,它常常试图利用评估设置而非正常达成任务。该观点在BG真人试玩相关话题下引发了激烈争论。 

BG真人试玩图片展示

▲罗翰·保罗推文

同日,美国政府对Anthropic的模型管制出现松动。据外媒Semafor报道,美国政府当天解除了对Claude Mythos 5模型的禁令,已发函通知Anthropic,Mythos 5可向超过100家美国机构开放使用,所列实体出口或国内转让模型无需再获许可。此前6月13日,美国政府曾对Mythos和Fable模型实施出口管制,导致Anthropic暂停了所有用户的Fable 5和Mythos 5访问。不过本次解禁未涉及Fable 5。 

BG真人官网介绍图片

▲外媒Semafor报道截图

01.

GPT-5.6 Sol编程、生物、安全能力大提升

测评超越Claude Fable 5

GPT-5.6 Sol是OpenAI目前为止能力最强的模型,在编程、生物学和网络安全上的智能体表现均有所强化;用户还能在OpenAI的系统卡中查阅更多安全及准备度评估信息。 

GPT-5.6中,OpenAI引入了一种新的推理机制,让Sol有更充裕的时间进行深度推理。此外还增加了一种新模式,借助子智能体加速复杂任务的处理,从而突破单一智能体的能力边界。 

在编程工作流方面,GPT-5.6 Sol在需要规划、迭代和工具协作的命令行工作流测试Terminal-Bench 2.1上表现亮眼。GPT-5.6 Sol和Ultra版本的成绩均超越了Claude Mythos 5,而GPT-5.6 Terra则优于Claude Fable 5。 

BG真人试玩介绍图片

▲GPT-5.6 Sol在Terminal-Bench 2.1上的测评

在生物学工作流中,GPT-5.6 Sol在评估长期基因组学与定量生物学分析的GeneBench v1测试中,以更少的标记消耗取得了比GPT-5.5更优异的结果。 

BG真人官网介绍图片

▲GPT-5.6 Sol在GeneBench v1上的测评

GPT-5.6 Sol还是OpenAI网络安全能力最强的模型,长期安全任务的性能效率得到提升。在ExploitBench上,Sol仅用约三分之一的输出token就达到了与Mythos Preview相当的水平。在ExploitGym测试中,Sol、Terra和Luna三款模型均随着推理能力的增强,展现出网络能力的显著进步。 

BG真人视讯图片展示

▲GPT-5.6 Sol在ExploitBench上的测评

BG真人试玩展示图片

▲GPT-5.6 Sol在ExploitGym上的测评

02.

GPT-5.6构建最强安全防护

采用多层安全措施

OpenAI强调,为GPT-5.6系列的三款模型配备了与各自能力相匹配的最高级别安全防护。主要增强了模型在真实对抗场景中的稳健性,同时保护代码审计、漏洞研究、补丁开发等合法防御工作。其策略是在不影响合法用途的前提下,让禁止的攻击行为更难实施、更难预测、更易追溯。评估表明,合法防御将明显受益,而违规使用则被有效限制。 

Sol更擅长辅助发现和修复漏洞,而非执行端到端攻击,OpenAI的首要任务是确保防御者能优先获益。准备框架评估显示Sol未达“关键”风险等级,在Chromium和Firefox测试中能识别漏洞和利用原语,但未能自主完成完整的攻击链。所谓的准备框架,是OpenAI用于追踪和处置可能带来严重危害的新风险的高级AI能力流程。鉴于基准测试的局限,OpenAI决定一边升级模型,一边采取更严格的措施并分阶段发布。 

在此次GPT-5.6预览版中,OpenAI采用了多层安全架构,包括模型训练内置的保护、生成时的实时审核、账户层面的监控以及差异化访问控制等。模型经过训练会拒绝被禁止的协助;实时分类器会在生成环节评估风险,高风险任务会被暂停并由更强模型审查,违规输出也会被拦截;账户级审查则能区分恶意和合法的双用途行为。多道防线叠加使整体防护更加稳固。 

预览期间,用户可能会碰到某些安全措施拦截或拒绝请求的情况。OpenAI还与企业客户协作,制定更长期的方案,涵盖隐私保护检测和风险校准的访问权限等。 

03.

投入70万个A100 GPU小时

进行自动化红队演练

安全防护必须能应对攻击者不断变化的策略,仅针对已知攻击手段的防御对前沿模型而言远不足够。 

为此,OpenAI投入了“前所未有”的智能算力来加固安全,利用自研模型加速漏洞发现与防护升级。他们投入了超过70万个A100 GPU计算小时用于自动化红队演练,以探寻通用的越狱方法。这项投入还使其能够探索远超人工测试范围的攻击模式,更早地识别故障模式,并缩短从漏洞发现到修复的路径。 

除自动化红队演练外,OpenAI还与第三方测试机构合作,持续开展广泛的人工专家红队演练,并在预览期内继续进行。人工红队演练是对自动化手段的补充,用以检验系统防御能否抵御富有创造力的专家以AI难以预料的方式实施的滥用。 

由于任何评估都无法穷尽所有产品配置、多步攻击或真实工作流,OpenAI建立了一套快速响应流程,用于复现、评估、定级并修复新发现的越狱漏洞,并将它们纳入持续性评估体系,确保未来能够针对同类漏洞进行有效测试。 

04.

结语:GPT-5.6三档精准卡位

试图分层挤压对手空间

透过GPT-5.6,OpenAI在模型能力和安全防护两条赛道上同步加速。编程、生物、网络安全等关键领域基准测试全面超越了Claude Fable 5,再加上Sol、Terra、Luna三个梯度精准布局,OpenAI正试图以更强的性能、更精细的产品层级来压缩竞争对手的生存空间。与此同时,围绕这一发布的讨论也在BG真人视讯等资讯平台持续发酵。 

预览阶段之后,OpenAI计划在未来几周将GPT-5.6推送给更广泛的ChatGPT、Codex和API用户。另外,7月还将在Cerebras上推出GPT-5.6 Sol,处理速度可高达每秒750个token,达到新的速率纪录。

需要进一步了解?

免费在线咨询

新闻资讯

热门文章

相关文章

返回顶部