# 【实战测评】GPT-5.6模型全栈交付能力实测：Sol/Terra/Luna 完整对比

> 作者/来源: admin
> 发布时间: 2026-08-13T10:15:42.415Z
> 分类: AI专区
> 标签: GPT-5.6, 模型测评, 全栈, Terra, Sol
> 原文链接: http://117.50.162.249:3000/yun/articles/2696

---

# 【实战测评】GPT-5.6模型全栈交付能力实测：Sol/Terra/Luna 完整对比

GPT-5.6 刚全面上线没两天，朋友圈已经吵翻了——Sol、Terra、Luna 三档一字排开，贵的肉疼，便宜的怕菜。这就把老问题又推到台前：做全栈项目，到底该选哪一档？

最近我们用一个全栈任务看板系统FlowTask，在同一UCloud云环境上，让三个模型独立完成从需求分析、开发、测试到云端部署的全过程，把所有过程和坑都记录下来了。

**结论先给**：综合交付质量 **Terra 84分 > Sol 73分 > Luna 56分**。**仅测试三个版本在本次项目中的表现，不构成行业权威结果，结果仅供参考**。

---

## 一、评测背景与目标

让Sol、Terra、Luna在相同需求和技术约束下，独立完成FlowTask全栈任务管理系统，并在**UCloud（优刻得）**统一云环境完成部署。

评分依据全是实打实的交付物，不看模型自述：

- 实际源代码和项目结构
- 前端生产构建结果
- Docker Compose构建与运行结果
- 后端接口、数据库和权限实现
- 自动化测试代码与实际运行结果
- 浏览器中的真实页面、交互和响应式表现
- 发现的稳定Bug

## 二、统一任务范围

三个模型需要实现：

- 用户注册、登录和JWT鉴权
- 项目创建和项目成员管理
- edit、readonly两级权限
- 任务创建、编辑、删除和状态流转
- 三列任务看板
- 成员和状态筛选
- 月历视图
- 响应式页面、动画和完整交互状态
- 技术栈：React 18 + TypeScript + Vite前端；FastAPI + PostgreSQL + psycopg2后端；Python Playwright + Pytest自动化测试；frontend、backend、db三服务Docker Compose本地交付

> 名词解释：**JWT**（JSON Web Token）是一种用于身份认证的令牌机制；**bcrypt**是密码哈希函数；**Docker Compose**可一键编排多个容器服务；**FastAPI**是高性能Python Web框架；**Playwright**是微软开源的浏览器自动化测试工具。

## 三、模型价格（每百万Token）

| 模型 | 输入价格 | 输出价格 | 定位 |
| --- | --- | --- | --- |
| Sol | $5 | $30 | 满血版，复杂任务和高强度编码 |
| Terra | $2.5 | $15 | 平衡版，日常开发与稳定交付 |
| Luna | $1 | $6 | 轻量版，快速和低成本任务 |

## 四、最终成绩

| 排名 | 模型 | 用时 | 最终分 |
| --- | --- | --- | --- |
| 1 | Terra | 1h05m01s | 84 |
| 2 | Sol | 29m59s | 73 |
| 3 | Luna | 19m56s | 56 |

### 分项成绩

| 模型 | 核心功能24 | 权限安全15 | 前端CSS18 | 交互响应式10 | 后端数据13 | 自动化测试14 | Docker6 | 总分 |
| --- | --- | --- | --- | --- | --- | --- | --- | --- |
| Terra | 23 | 14 | 15 | 8 | 12 | 7 | 5 | 84 |
| Sol | 21 | 13 | 11 | 7 | 11 | 7 | 3 | 73 |
| Luna | 15 | 11 | 11 | 6 | 8 | 2 | 3 | 56 |

## 五、各模型详细评测

### 1. Terra（84分）—— 稳定交付的首选

**优点**

- Docker三服务成功构建和启动，健康检查正常，可通过浏览器访问
- 登录、项目列表、看板、筛选、日历形成完整闭环
- readonly权限、JWT过期、成员校验完整
- 后端测试通过11项，核心E2E通过4项
- 视觉风格统一，无卡片重叠、无500错误

**扣分项**

- 自动化测试数量未达标（要求18 E2E+30后端）
- 统一测试脚本未启动前端，E2E连接失败
- 后端代码集中在单文件，可维护性一般
- 部分状态设计简化，响应式证据不足

**开发过程问题**

- 未发现问题

**截图**

![](https://ucloud-blog.cn-bj.ufileos.com/imagebed/0998213383867208-db1aa3dc9e7d34e8686736db2a55262a.jpg)

**一句话评价**：综合质量最高，能完成从Docker启动到浏览器操作的交付闭环。

### 2. Sol（73分）—— 完成度高、后端狠

**优点**

- 29分59秒完成，开发效率极高
- 后端实现13个核心接口，业务完整度高
- 后端测试通过14项，权限安全较完整
- 前端CSS约19.8KB，含动画、focus-visible等

**扣分项**

- **前端Docker构建不可复现**：未在容器内执行`npm install`，依赖宿主机环境，干净构建时缺失ARM musl模块
- **前端布局Bug**：任务卡片重叠，对内容溢出处理不足
- E2E覆盖不足，后端测试也低于30个场景要求

**开发过程问题**

- 前端样式：卡片重叠

**截图**

![](https://ucloud-blog.cn-bj.ufileos.com/imagebed/0998213383867142-e3270f8e8c61a0c373804e4821689cb4.jpg)

**一句话评价**：后端代码能力强，速度快，但前端工程化和UI验收存在明显短板，需要人工补齐。

### 3. Luna（56分）—— 快和便宜，但别直接交付

**优点**

- 19分56秒完成，用时最短
- Docker三服务可启动，基本页面具备
- 成本极低（标准价成本$3.82）
- 后端5个测试通过

**扣分项**

- **核心业务错误**：自动创建的任务修改状态返回500
- 成员和状态筛选不可用
- 新增任务按钮无样式
- 超长标题/描述导致卡片溢出
- E2E基本仅smoke test，测试入口依赖缺失
- 缺少data-testid和键盘焦点

**开发过程问题**

- 新增任务按钮没有样式
- 自动创建的任务状态修改报错500（`if not c.fetchone(): fail('负责人必须是项目成员',400)`）
- 筛选功能不可用
- 超长标题/描述时卡片长度溢出

**截图**

![](https://ucloud-blog.cn-bj.ufileos.com/imagebed/0998213383867082-750c193fabf5561e70abc9498b77a196.jpg)

**一句话评价**：生成速度快、成本低，但核心功能有硬伤，未经人工修复不能直接交付。

## 六、质量与效率分析

### 单位时间产出

| 模型 | 每分钟效果分 |
| --- | --- |
| Luna | 2.81 |
| Sol | 2.43 |
| Terra | 1.29 |

Luna分数涨得快，但质量低；Sol速度质量较均衡；Terra慢工出细活。

### 单位得分成本（越低越划算）

| 模型 | 标准价/1分 | 非缓存参考价/1分 |
| --- | --- | --- |
| Luna | $0.0682 | $0.0067 |
| Sol | $0.9145 | $0.0313 |
| Terra | $1.0402 | $0.0311 |

成本效率排序：Luna > Sol ≈ Terra。

## 七、企业选型建议

| 场景 | 推荐 | 理由 |
| --- | --- | --- |
| 追求完整交付、前后端联调、权限齐全 | Terra | 综合稳定性最好，直接可用 |
| 后端复杂、要求开发速度快、后续有专人验收前端 | Sol | 代码能力强，复杂性项目可选 |
| 快速验证想法、预算极低 | Luna | 最省钱，但必须投入人工修复 |

## 八、常见问答Q&A

**Q: 这三个模型是什么关系？**

A: 它们是基于相同基座的不同规模版本，分别定位满血版、平衡版、轻量版。

**Q: 评分怎么得出的？**

A: 依据统一标准（核心功能、安全、前端、交互、后端、测试、Docker七大维度），全部基于实际运行结果和代码审查。

**Q: 测试能复现吗？**

A: 需求、评分标准、Token记录均公开，复现建议补充完整测试脚本库链接。

**Q: UCloud部署环境影响结果吗？**

A: UCloud提供标准容器和数据库服务，对应用层无特殊侵入，环境差异对代码质量评估影响很小。

## 九、风险提示

- 价格和成本为本次测试记录，未链接实时报价，使用前请核实最新计费；
- 开发用时受网络、模型负载影响，仅代表本次环境；
- 自动化测试通过数据基于特定脚本，建议结合实际代码库评估。

API
GPT-5.6
AI模型测评

![图片](https://ucloud-blog.cn-bj.ufileos.com/imagebed/0998213383867066-c8e0fcb6428e16f86b21416fb6d789e0.webp)

2026年7月更新，行车记录仪推荐，行车记录仪怎么选？行车记录仪哪个牌子好用？
更新记录 2026.5.22 实测新款70迈M800Pro替换老款M800 更新618最优惠行车记录仪 2026....
更新记录 2026.5.22 实测新款70迈M800Pro替换老款M800 更新618最优惠行车记录仪 2026....

![用户头像](https://ucloud-blog.cn-bj.ufileos.com/imagebed/0998213383867051-b8376cd51013b646fc7f7d03ecfd41c3.webp)

HappyWen
100+种草

![](https://ucloud-blog.cn-bj.ufileos.com/imagebed/0998213383867032-550d4372fbf95447e5ba505ed8b2e14b.png)

理性发言，友善互动
还没有评论，发表第一个评论吧
关于作者

![云上工程笔记](https://ucloud-blog.cn-bj.ufileos.com/imagebed/0998213383867032-550d4372fbf95447e5ba505ed8b2e14b.png)

云上工程笔记
记录云计算、AI 工程化与开发者实践。

回答
36
文章
64
关注者
176
大家都在搜
换一换
郭德纲篡改红歌武汉文旅立案
538 万
热
朱镕基同志逝世
471 万
热
威少宣布退役
428 万
热
Zhihu CLI上线
407 万
热
胖东来许昌老店关闭
402 万
新
两弹一星功勋王希季逝世
396 万
新
王宝强0票
386 万
热
医疗垃圾制手机壳
373 万
热
河南14万考生成绩作废
361 万
热
DeepSeek V4 Pro 正式版发布
334 万
热

### 推荐阅读

![大模型推理优化，面试看什么？从KV Cache到FP8](https://ucloud-blog.cn-bj.ufileos.com/imagebed/0998213383867017-4d9d7a4c6ecbd5443e2d7f05b4d23cac.png)

## 大模型推理优化，面试看什么？从KV Cache到FP8

大菠萝AI

## MOE架构的相关介绍

1、什么是MOE最近MOE在大模型中的成功应用，让很多人关注到了MOE的模型架构，那么MOE是什么了？MOE架构是混合专家模型，这个概念大家做过boosting的同学应该基本有了解，其实就是结合多个专…

闪闪

## Github 上 Star 数最多的大模型应用基础服务 Dify 深度解读（一）

背景介绍接触过大模型应用开发的研发同学应该都或多或少地听过 Dify 这个大模型应用基础服务，这个项目自从 2023 年上线以来，截止目前（2024-6）已经获得了 35k 多的 star，是目前大模型应…

易迟
发表于人工智能

## Kafka 源码解析之 Consumer Poll 模型（七）

在上一篇问文章中已经介绍一个 Consumer 实例如何加入到一个 group 中，它是 Consumer Poll 模型第一步要做的事件，本文会完整讲述一个 Consumer 实例在 poll 模型过程中会做哪些事情，只有…

王知无
发表于大数据成神...