近日,SuSu_酥酥宣布了一个好消息:GPT-6 Astra在Terminal-Bench 4.0的编程测试中获得了第一名,以58.2%的得分超越了Fable 5.1的57.9%。尽管得分差距仅为0.3分,但Astra的成本却只有Fable的一半,分别为3.3k美元与6.2k美元。第三名是Opus 5,得分为51.8%,成本为6.0k美元,使用的tokens为6.5B。而Astra仅用1.5B tokens,就将分数拉开了6.4点。
Terminal-Bench是一个用于评估AI在终端执行复杂编程任务能力的测试,难度远高于普通代码生成,因为它要求AI不仅理解项目结构,还能调试错误、进行测试和修复问题。Astra的表现令人瞩目,成为最强的编程AI,并且保持了最高的性价比。过去,用户在选择AI时可能会考虑Fable,因为它能力强大,但现在Astra凭借更高的能力和更低的成本,正成为更具吸引力的选择。
Codex是OpenAI开发的编程助手,能够在终端执行编程任务。Astra作为决策的“大脑”,而Codex则是具体执行的“手”。这种组合使Astra与Codex成为当前最强的编程协作伙伴。
知名AI博主宝玉也提到,使用GPT-6 Astra后,令人最惊艳的是其计算机使用能力,与之前的版本相比,它可以更快速、精准地进行App测试。这样的提高形成了从开发到验收的完整闭环。在过去,AI完成代码后,用户仍需自己测试和修复bug。而现在,Astra能够自主完成测试、修复问题和验收,用户只需提供需求,Astra便会交付可以直接使用的结果。
对程序员而言,这既是好消息也是坏消息。好的方面是编码工作变得轻松,Astra承担了大部分任务;坏的方面是,企业可能不再需要如此多的程序员。一名资深程序员与Astra合作的效率,可能相当于过去五名普通程序员的工作量。那么剩下的四名程序员将何去何从?
虽然Astra能够编写代码,但它仍然缺乏对代码内容的理解,因此产品需求、系统设计和架构决策等关键任务依然需要人类来完成。因此,程序员未来的角色将需要转向“系统设计者”,而不仅仅是“代码编写者”。只会编写代码的程序员可能会被Astra取代,而能设计系统、定义需求并把控质量的人员,将因Astra的出现变得更具价值。
发表评论