9月的大模型竞争依旧激烈,除了榜单排名,模型处理真实任务的能力、响应速度、调用成本和终端适配,也成为衡量基础模型公司的重要标准。阶跃星辰发布新一代开源旗舰基础模型 Step 5 Preview。在全球权威的 Artificial Analysis Intelligence Index 中,Step 5 Preview 取得 44 分,位列全球开源模型前三,并进入模型智能水平与单任务成本权衡的“帕累托前沿”。

阶跃星辰 Step 5 Preview 实测:开源旗舰模型的新位置

Step 5 Preview 面向 AI 编程、软件工程、专业知识工作、金融等场景,擅长需要长上下文、多轮工具调用与持续执行的任务。模型采用稀疏 MoE 架构,总参数量为 600B,实际激活参数为 27B,原生支持文本与视觉输入,上下文长度达到 1M。APPSO 通过 WorkBuddy 接入模型,覆盖编程、设计、3D 生成、深度调研和数据分析等方向进行实测。

编程与多场景实测

在编程测试中,Step 5 Preview 从 Three.js 五子棋入手,完成了落子、轮次切换和胜负判定,并加入人机对弈环节。威尼斯快艇游戏里,它把水面、建筑与镜头运动组织在同一场景中。卡帕多奇亚热气球场景要求数十个气球同时飞行,并可调整日照、风向和观察视角,模型仍保持了较完整的场景结构和交互逻辑。尼亚加拉瀑布测试涉及动态水体、水雾、彩虹、游船、多视角和季节切换,模型兼顾了视觉效果、交互逻辑与运行效率。网页操作系统测试中,Step 5 Preview 交出的页面在界面完整度、功能衔接和细节还原上,相比此前用 DeepSeek V4 Pro 和 DeepSeek V4.1 Flash 测试的同类 Mac 操作系统任务更进一步。太空行星、夜间跑车和狮身人面像等网页设计与 3D 资产测试,也体现出它对视觉层级和空间表达的理解;一张随手拍摄的照片,它能在数分钟内还原出具备基本结构和空间细节的模型。

调研与金融任务

深度调研更考验证据组织、专业知识与判断能力,金融则是检验综合能力的典型场景。阶跃围绕公司研究这一高难度金融工作流构建了三项内部评测,并引入包含 220 道专家问题、11543 项评估标准的 FrontierFinance。官方结果显示,Step 5 Preview 在四项金融基准中的表现均接近 Claude Opus 5。APPSO 的实测中,小折叠手机立项报告要求串联用户投诉、外屏生态和售后成本,并给出有依据的产品建议;广州、佛山七日游则加入预算、体力和严格素食限制,模型不仅持续遵循约束条件,方案也有更高的可行性。