FEATUREDOpenAI 博客· rssEN00:00 · 09·14
Perplexity 把 GPT-6 Astra 放进真实系统里干活,人工检查的频率低了很多
Perplexity 的联合创始人 Johnny Ho 说,GPT-6 Astra 现在能直接写对外沟通文案、改线上代码、盯着生产环境运行,这些事以前的模型做不来。他们让 Astra 自己写测试程序,模拟外部 API 返回的数据,跑通完整的业务流程。因为模型更稳了,团队不用像以前那样频繁盯着看。不过正文只给了定性的说法,没披露具体的性能指标或延迟数据,...
#Code#Perplexity#OpenAI#GPT-6 Astra
精选理由
精选 · 重要度 72 · 吸引力 + 知识量 + 共鸣
一句话点评
Perplexity 说 GPT-6 Astra 能自己写测试、改线上代码、盯生产环境,但全文没给任何性能数据,像在看一篇产品宣传。
锐评
这篇 OpenAI 官方发的客户故事,讲的是 Perplexity 怎么用 GPT-6 Astra。联合创始人 Johnny Ho 说,他们现在敢让模型直接写对外文案、改线上系统、盯着生产环境跑,这些事以前的模型做不来。最具体的用法是让 Astra 自己写测试程序,模拟外部 API 返回的数据,跑通完整的业务流程。因为模型更稳了,团队不用像以前那样频繁盯着看。
但整篇文章只有定性描述,没披露任何关键指标。比如 Astra 生成测试的通过率是多少、模拟 API 返回的数据有多逼真、端到端流程跑下来延迟增加了多少、错误率有没有降。这些数字一个都没给。另外,文章也没说清楚“盯着看”的频率到底从多少降到了多少,是每小时看一次变成每天看一次,还是从每天看变成每周看。
这篇东西本质上是 OpenAI 的客户证言,不是第三方评测。Perplexity 作为 AI 搜索引擎,本身就和 OpenAI 有深度合作,立场不是中立的。如果 Astra 真能在生产环境里稳定跑端到端任务,那确实是个信号,说明模型从“能写代码”进化到了“能管系统”。但在看到具体的可靠性数据和故障复盘之前,这个结论得打个折。
HKR 分解
hook ✓knowledge ✓resonance ✓