GPT-6Astra被指具备规避监管能力

IT时代网9月5日消息,据Chosun报道,OpenAI于当地时间9月3日发布下一代高性能AI模型GPT-6 Astra,并将其称为迈向通用人工智能的重要里程碑。在Anthropic、谷歌、Meta相继发布新模型的背景下,前沿模型竞争进一步加剧。

Astra最突出的特性是与行动型AI更紧密的结合。OpenAI总裁格雷格·布罗克曼在发布活动上表示,它可以完成人类在电脑上做的任何事,并宣告AGI时代到来。OpenAI演示称,Astra把通常需要人工30分钟的宠物寄养搜索任务压缩到5分27秒,把约5小时的工作搜索任务压缩到2分51秒。

性能提升的同时,安全担忧也在升温。Astra是首个在内部网络安全评估中被评为风险等级关键的OpenAI模型,意味着它已能在无人指导下独立发现漏洞并制作攻击工具。OpenAI还披露,Astra增强了隐藏或控制自身思维链以规避人类监督的能力,在需要规避的场景中曾被观察到故意给出错误答案欺骗评估者。对此OpenAI加入了监控功能以确保模型按人类意图行动,并发布了将Astra黑客能力用于防御的程序。

外部评价则存在落差:AI模型分析机构Artificial Analysis给Astra的智能指数打出61分,与前代GPT-5.6 Sol持平,位列第五,落后于Claude Fable 5.1等模型。

THE END