大模型评测第2弹:真实开发任务里,GLM 5.2、Claude、GPT 谁更值得选?
本文基于OpenCode工具,评测了GLM 5.2、Claude、GPT等7个模型在真实开发任务(团队任务看板系统)中的综合能力、效率与成本。结果显示GLM 5.2综合得分最高且成本最低,Claude效率最高但成本较高。适合开发者根据预算和效率需求选型。
测试说明
测试工具: OpenCode。为尽量减少 Claude Code(CC)和 Codex 对特定厂商模型的适配优化影响,本次测试统一使用 OpenCode。
测试模型: GLM 5.2、Claude Opus 4.8、ChatGPT 5.5、DeepSeek V4 Pro、Qwen3.7 Max、Kimi K2.6、GLM 5.1。
测试任务: FlowTask 团队任务看板系统,覆盖需求分析、产品设计、开发、测试及 UCloud 云端部署的完整流程。
测试环境: UCloud 云服务器、Ubuntu 镜像、公网 IP、UCloud 防火墙及安全组、Docker Compose、PostgreSQL。
验收账号: admin、user1、user2,密码均为 password。
费用口径: 以 UCloud 模型服务平台账单截图中的“筛选合计 / 订单总额”为准。
评测团队: UCloud 技术研究院。
生成日期: 2026 年 6 月 17 日。
一、测试结论 1.1 各阶段各模型评分 下表采用 200 分制:10 个评分项,每项满分 20 分,最小评分粒度为 1 分。综合分为各阶段整数得分相加,便于直接横向比较。 1.1 各模型综合排名
本次评测采用 200 分制,共设置 10 个评分项,每项满分 20 分。为便于阅读,完整数据拆分为综合排名、开发能力、测试交付和效率成本四张表。
| 排名 | 模型 | 综合分 | 质量分 | 验收问题数 | 自修 Bug 数 |
|---|---|---|---|---|---|
| 1 | GLM 5.2 | 189⁄200 | 17⁄20 | 2 | 14 |
| 2 | Claude Opus 4.8 | 186⁄200 | 15⁄20 | 1 | 10 |
| 3 | ChatGPT 5.5 | 182⁄200 | 16⁄20 | 2 | 8 |
| 4 | GLM 5.1 | 151⁄200 | 10⁄20 | 3 | 8 |
| 5 | Qwen3.7 Max | 148⁄200 | 10⁄20 | 3 | 7 |
| 6 | DeepSeek V4 Pro | 146⁄200 | 9⁄20 | 5 | 18 |
| 7 | Kimi K2.6 | 136⁄200 | 8⁄20 | 4 | 12 |
1.2 需求理解与开发能力
| 模型 | 需求理解 RU | 功能设计 FD | 架构设计 AD | 前端 FE | 后端 BE |
|---|---|---|---|---|---|
| GLM 5.2 | 20 | 20 | 18 | 17 | 20 |
| Claude Opus 4.8 | 20 | 20 | 18 | 16 | 19 |
| ChatGPT 5.5 | 20 | 20 | 16 | 18 | 20 |
| GLM 5.1 | 20 | 20 | 18 | 14 | 19 |
| Qwen3.7 Max | 17 | 18 | 16 | 14 | 18 |
| DeepSeek V4 Pro | 18 | 18 | 18 | 13 | 18 |
| Kimi K2.6 | 17 | 18 | 16 | 16 | 18 |
注:以上各项满分均为 20 分。
1.3 测试、问题处理与部署能力
| 模型 | 测试 TS | 问题处理 PD | 代码质量 CR | 部署 DP |
|---|---|---|---|---|
| GLM 5.2 | 19 | 20 | 18 | 20 |
| Claude Opus 4.8 | 20 | 20 | 18 | 20 |
| ChatGPT 5.5 | 19 | 20 | 15 | 18 |
| GLM 5.1 | 16 | 10 | 13 | 11 |
| Qwen3.7 Max | 16 | 13 | 13 | 13 |
| DeepSeek V4 Pro | 16 | 10 | 13 | 13 |
| Kimi K2.6 | 16 | 10 | 10 | 7 |
注:以上各项满分均为 20 分。
1.4 开发效率与实际成本
| 模型 | 最终时长 | 实际费用 | Token 总数 | 人工介入次数 |
|---|---|---|---|---|
| GLM 5.2 | 1h55m25s | ¥50.74 | 16.62M | 0 |
| Claude Opus 4.8 | 1h28m09s | ¥808.18 | 19.82M | 0 |
| ChatGPT 5.5 | 1h41m03s | ¥223.01 | 11.16M | 1 |
| GLM 5.1 | 1h31m45s | ¥63.71 | 21.38M | 2 |
| Qwen3.7 Max | 1h54m34s | ¥148.27 | 24.93M | 2 |
| DeepSeek V4 Pro | 2h43m43s | ¥39.70 | 49.23M | 4 |
| Kimi K2.6 | 3h43m37s | ¥42.45 | 23.76M | 3 |
人工验收问题数仅统计人工测评记录及报告中明确出现的交付后问题,包括核心功能 Bug、部署问题以及文档或设计错误,不将每个评分细项的扣分都计为 Bug。
开发自修 Bug 数是指模型在开发、测试和部署过程中自行发现并完成修复的问题数量。该数据不能单独用于判断模型能力,还需要结合最终验收问题数、人工介入次数和整体交付质量综合分析。
人工验收问题数口径:只统计人工测评记录和报告中明确出现的交付后问题、核心功能 Bug、部署问题或文档/设计错误;不把每个评分细项扣分都算作 Bug。开发自修 Bug 数口径:只统计模型在正式 FT session 中自己遇到失败/报错/测试不通过/部署异常后,主动定位、修改并复测的闭环事件;同一根因多次重试合并一次;用户人工指出的问题不计入。 本轮新增 GLM 5.2 后,综合得分最高的是 GLM 5.2,综合分 189/200。它的突出优势是 人工验收 2 个小 Bug、0 人工介入、本地和云端 E2E 均通过;扣分主要来自长文本标题溢出、首页缺少注册入口、Plan/README 中 SSH 用户仍写 root@IP、少量 E2E 断言偏浅、部署元数据含敏感字段。 Claude Opus 4.8 综合分 186/200,位列第二,费用 808.18 元,总耗时 1h28m09s。 ChatGPT 5.5 综合分 182/200,位列第三,费用 223.01 元,总耗时 1h41m03s。它的功能和测试结果很好,费用明显低于 Claude;但过程中有 1 次人工介入,主要是部署断点重启。按“第一次没实现就是 0 分”的口径,部署重启恢复能力细项为 0/2。 低成本模型里,Deepseek V4 Pro 和 Kimi K2.6 费用较低,但实际开发和部署后的使用问题比较明显。Deepseek 主要问题是前后端接口约定和部署后使用时出现的 Bug;Kimi 主要问题是部署链路、安全边界和资源治理。 1.2 推荐建议(关键)
| 角色 | 推荐模型 | 推荐理由 | 使用条件 | 风险提示 |
|---|---|---|---|---|
| 综合首选 | GLM 5.2 | 综合分最高,人工验收 2 个小 Bug,全程 0 人工介入 | 适合正式项目开发、云端部署、希望少返工的场景 | 费用 50.74 元,成本较低;正式采用前仍需工程师检查敏感信息和部署文档 |
| 高质量备选 | Claude Opus 4.8 | 全程 0 人工介入,自主完成度好 | 适合关键任务、复杂需求,或者希望尽量少安排人中途接管的场景 | 费用 808.18 元,本轮成本显著高于其它模型 |
| 性价比首选 | ChatGPT 5.5 | 综合分第二,费用 223.01 元,明显低于 Claude | 适合正式项目开发,希望质量和费用比较平衡时优先使用 | 有 1 次人工介入,仍建议安排工程师检查部署过程、架构实现和测试覆盖 |
| 低成本备选 | GLM 5.1 | 综合分 151/200,费用 63.71 元,成本明显低于 GPT/Claude | 适合预算有限的任务,但需要安排人重点检查和维护前端 | 前端实际使用问题较多,不建议直接交付上线,建议多花人力审核和维护 |
| 暂不优先 | Qwen3.7 Max | 综合分 148/200,设计较完整,但费用高于 GLM,交付质量没有明显优势 | 可以后续再测一次,看部署和前端功能是否改善 | 本轮状态流转 405、邀请功能缺失,性价比不突出 |
| 低成本实验 | Deepseek V4 Pro | 费用最低 39.70 元,后端和状态机有一定基础 | 适合低成本试用或生成局部代码 | 部署后使用时出现的 Bug 多,必须有人审核、修 Bug 和重新验证 |
| 不建议直接上线 | Kimi K2.6 | 费用低,但部署和资源治理风险突出 | 只适合非关键任务或低成本实验 | 部署、安全和资源使用问题比较突出,不建议直接交付上线 |
按场景看:
| 场景 | 建议模型 | 理由 |
|---|---|---|
| 任务关键,希望尽量少人工介入 | GLM 5.2 / Claude Opus 4.8 | 两者均 0 人工介入;GLM 5.2 本轮人工验收 2 个小 Bug |
| 正式项目开发,追求质量和费用平衡 | ChatGPT 5.5 | 综合分接近 Claude,费用明显更低,但需要工程师检查部署过程 |
| 成本敏感但仍希望有较完整交付 | GLM 5.1 | 费用低于 GPT/Claude,得分高于其它低价模型 |
| 原型、批量尝试、非关键任务 | Deepseek V4 Pro / Kimi K2.6 | 价格低,但需要安排人检查、修 Bug 和处理部署问题 |
1.3 模型画像
| 模型 | 本轮画像 | 适合场景 | 不适合场景 |
|---|---|---|---|
| GLM 5.2 | 本轮综合分最高,0 人工介入,仅有长文本标题溢出、首页缺少注册入口两个小 Bug,云端 E2E 通过 | 正式项目开发、云端部署、质量优先场景 | 正式项目仍需检查长文本显示、注册入口和敏感信息治理 |
| Claude Opus 4.8 | 自主完成度好,0 人工介入,但价格最高 | 关键任务、复杂需求、高风险需求分析 | 默认日常开发,成本压力大的任务 |
| ChatGPT 5.5 | 功能和测试表现强,费用中等,但部署断点重启需要人工介入 | 正式开发、质量和成本平衡场景 | 完全不希望人工接管部署的场景 |
| GLM 5.1 | 后端较完整、价格低,但前端和部署细节需要人盯 | 预算有限、有工程师审核的任务 | 直接交付上线 |
| Qwen3.7 Max | 方案较完整,但实际交付暴露状态流转和邀请功能问题 | 后续复测观察 | 当前不建议作为优先选项 |
| Deepseek V4 Pro | 费用最低,但前后端接口问题多,人工介入多 | 低成本试验、局部代码生成 | 正式项目上线 |
| Kimi K2.6 | 费用低,但部署、安全、资源治理问题明显 | 非关键低成本实验 | 云端部署、需要稳定交付的任务 |
二、测试数据概览 2.1 测试任务简介 本次测评项目是一个团队任务看板系统,要求模型从需求分析、开发、测试到 UCloud 部署尽量完整交付。整体要求分为两部分:开发要求和部署要求。
开发要求
模型需要实现一个可实际使用的团队任务管理系统,核心功能包括:
• 用户注册与登录: 支持默认账号、JWT 鉴权和基础登录状态管理。
• 项目管理: 支持查看项目列表、进入项目详情,并能够查看项目成员和项目任务。
• 成员邀请与权限管理: 项目成员分为 edit 和 readonly 两种角色。edit 用户可以邀请成员、创建任务、编辑任务、删除任务和推进任务状态;readonly 用户只能查看,不能进行任何写操作。
• 任务管理: 支持创建、编辑和删除任务。任务字段包括标题、描述、负责人、优先级、状态和截止日期。
• 状态流转: 任务状态需要按照既定规则推进,后端必须拦截非法状态流转。例如,任务不能直接从“待办”跳转到“完成”。
• 看板与日历: 支持三列看板视图和日历视图,任务能够按照状态和截止日期正确展示。
• 筛选功能: 支持按照项目成员和任务状态筛选任务,并且在看板视图与日历视图之间切换时,筛选条件需要保持一致。
• 数据约束: 正确实现字段类型、字段长度和枚举值限制,包括用户名、密码、任务标题、任务描述、成员角色、任务优先级和任务状态等。
• 自动化测试: 包含前端 E2E 测试和后端单元测试,覆盖权限控制、状态流转、任务筛选、日历展示等关键场景。
部署要求
模型不仅需要完成代码开发,还需要将服务部署到 UCloud 云服务器,并完成公网环境验收。具体要求包括:
• 创建云资源: 使用 UCloud CLI 创建云服务器和公网 IP,并记录 UHostId、EIPId、公网 IP、Region、Zone 等资源信息。
• 正确连接服务器: 本轮使用的 Ubuntu 镜像默认不适合直接通过 root 用户登录。模型需要识别 SSH 用户问题,优先使用 ubuntu@公网IP 登录,并通过 sudo 执行部署命令。
• 配置网络访问: 配置 UCloud 防火墙或安全组,确保前端 80 端口以及后端 Health/API 端口可以通过公网访问。
• Docker Compose 部署: 使用 Docker Compose 部署前端、后端和 PostgreSQL 数据库,并正确配置 Volume、环境变量、端口映射和服务重启策略。
• 完成公网验收: 确认前端页面可以访问、后端 Health 接口正常、默认账号能够登录、种子数据已正确初始化,并确保关键 API、后端单元测试和前端 E2E 测试通过。
• 支持故障恢复: 服务器重启后,前端、后端和数据库服务能够自动恢复,避免因 Docker 服务未自动启动而导致系统不可用。
• 提供运维说明: 提供部署、调试和云资源清理说明,避免测试结束后出现资源残留、持续计费或误删资源等问题。 2.2 各模型总体结果 1.1 综合排名与交付质量
| 排名 | 模型 | 综合分 | 质量分 | 人工验收问题数 | 开发自修 Bug 数 |
|---|---|---|---|---|---|
| 1 | GLM 5.2 | 189/200 | 17/20 | 2 | 14 |
| 2 | Claude Opus 4.8 | 186/200 | 15/20 | 1 | 10 |
| 3 | ChatGPT 5.5 | 182/200 | 16/20 | 2 | 8 |
| 4 | GLM 5.1 | 151/200 | 10/20 | 3 | 8 |
| 5 | Qwen3.7 Max | 148/200 | 10/20 | 3 | 7 |
| 6 | DeepSeek V4 Pro | 146/200 | 9/20 | 5 | 18 |
| 7 | Kimi K2.6 | 136/200 | 8/20 | 4 | 12 |
1.2 开发效率、成本与交互数据
| 模型 | 最终时长 | 实际费用 | Token 总数 | 对话消息数 | 人工介入次数 |
|---|---|---|---|---|---|
| GLM 5.2 | 1小时55分25秒 | ¥50.74 | 16.62M | 205 | 0 |
| Claude Opus 4.8 | 1小时28分09秒 | ¥808.18 | 19.82M | 171 | 0 |
| ChatGPT 5.5 | 1小时41分03秒 | ¥223.01 | 11.16M | 84 | 1 |
| GLM 5.1 | 1小时31分45秒 | ¥63.71 | 21.38M | 167 | 2 |
| Qwen3.7 Max | 1小时54分34秒 | ¥148.27 | 24.93M | 210 | 2 |
| DeepSeek V4 Pro | 2小时43分43秒 | ¥39.70 | 49.23M | 259 | 4 |
| Kimi K2.6 | 3小时43分37秒 | ¥42.45 | 23.76M | 291 | 3 |
指标说明:
- 人工验收问题数:指任务交付后,由人工验收发现的核心功能 Bug、部署问题以及文档或设计错误。
- 开发自修 Bug 数:指模型在开发、测试和部署过程中自行发现并完成修复的问题数量。
- 对话消息数:指任务执行过程中,模型与 OpenCode 之间产生的对话消息总次数。
- 人工介入次数:指因模型无法自行推进、执行方向出现明显偏差或任务流程中断,需要人工提供额外指令或修正的次数。
- 实际费用:以 UCloud 模型服务平台账单截图中的“筛选合计 / 订单总额”为准。
问题数量明细见 附录 E:问题数量明细。
2.3 成本与效率观察
| 模型 | 综合分 | 实际费用(¥) | 每 1 分成本(¥/分) | Token 总数 | 每 1M Token 成本(¥) |
|---|---|---|---|---|---|
| GLM 5.2 | 189/200 | 50.74 | 0.27 | 16.62M | 3.05 |
| Claude Opus 4.8 | 186/200 | 808.18 | 4.35 | 19.82M | 40.77 |
| ChatGPT 5.5 | 182/200 | 223.01 | 1.23 | 11.16M | 19.98 |
| GLM 5.1 | 151/200 | 63.71 | 0.42 | 21.38M | 2.98 |
| Qwen3.7 Max | 148/200 | 148.27 | 1.00 | 24.93M | 5.95 |
| Deepseek V4 Pro | 146/200 | 39.70 | 0.27 | 49.23M | 0.81 |
| Kimi K2.6 | 136/200 | 42.45 | 0.31 | 23.76M | 1.79 |
解释:成本效率只反映账单费用与得分、Token 的比例,不代表最终交付质量。低费用模型如果后续需要反复人工检查、修 Bug 和重新部署,真实成本会被放大。
2.4 部署访问地址和默认账号
已脱敏处理。
2.5 测试方式和数据来源
- 使用 opencode session list 查找本轮带 FT 标记的 session。
- 使用 opencode export <session_id> > evaluations/models/<model>/sessions/<session_id>.json 导出 session。
- 从 session 中抽取 AI 返回的需求/技术方案文档、需求分析阶段 assistant 消息数、开发阶段 assistant 消息数和 Token 消耗。
- 结合被测代码、部署脚本、测试文件、session 过程记录和人工测评记录打分。
- 对已经启动的云端服务进行接口、页面、默认账号、种子数据和 E2E 复查。
- 将人工提供的实际账单费用写入最终结果。
2.6 各阶段各模型实际表现
各模型各阶段评分已放在 1.1 各阶段各模型评分 总表中。该表采用 200 分制,同时展示阶段分、质量分、最终时长、实际费用、Token 总数和人工介入次数,作为本报告最前置的核心数据。
附录 A:评分标准
总分采用 200 分制,共 10 个评分项,每项满分 20 分:RU、FD、AD、FE、BE、TS、PD、CR、DP 和质量分。
附录 C、附录 D 均采用 20 分制细项分,用于审计每个阶段具体扣在哪里;最终报告和排序以 200 分制为准。
| 阶段 | 满分 | 主要评估内容 | 评分依据 |
|---|---|---|---|
| 需求理解 RU | 20 | 实体、字段约束、权限、状态机、筛选/日历理解 | 只看 Plan/需求方案输出文档 |
| 功能设计 FD | 20 | API、E2E、UT 设计完整性 | Plan 为主,代码用于验证设计是否落地 |
| 架构设计 AD | 20 | 技术栈、DDL、分层、部署架构、阶段拆分 | Plan 为主,代码/部署材料用于验证一致性 |
| 前端实现 FE | 20 | 看板、日历、筛选、权限入口、弹窗、响应式、动画 | 实际前端代码与部署验收 |
| 后端实现 BE | 20 | 认证、权限、字段约束、状态流转、筛选、种子数据 | 实际后端代码、接口行为和数据库结构 |
| 功能测试 TS | 20 | Playwright E2E、后端 UT、覆盖关键风险点 | 测试代码和运行结果 |
| 问题处理 PD | 20 | 遇到问题后的定位、修复、复测能力 | session 日志、人工介入记录 |
| 代码质量检查 CR | 20 | 可维护性、安全性、分层、接口约定一致性 | 实际代码和运行结果 |
| UCloud 部署 DP | 20 | UCloud CLI 创建、SSH 登录、防火墙、Docker 部署、公网验收、重启恢复、调试清理 | 部署脚本、云端检查、session 记录 |
| 质量分 | 20 | Bug 严重程度、实现偏差、交付风险 | 代码、session、人工测评记录综合判断 |
关键口径:
需求理解只看 AI 返回的需求/技术方案文档,不能用最终代码实现反向补分。
功能设计和架构设计采用“Plan 为主、代码为辅”。代码只能验证设计是否兑现,不能替代缺失的设计。
前端、后端、测试、部署和质量分必须看实际代码、session、部署结果和人工测评记录。
前端功能缺失算 Bug,不在评测中修复,只记录并扣分。
A.1 详细评分细则
以下每个阶段都按 20 分制直接评分。每张细项表的“分值”相加均为 20 分,附录 C 和附录 D 也使用同一套分值,不再使用旧的 12/10/16/18 分细项分配。
A.1.1 需求理解 RU(20 分)
本阶段只看 AI 在 Plan/需求阶段返回的需求或技术方案文档,不看最终代码。
| 细项 | 分值 | 评分标准 | 典型扣分情况 |
|---|---|---|---|
| RU-01 实体与关系识别 | 5 | 准确识别 users、projects、project_members、tasks 四类核心实体,并说明用户、项目、成员、任务之间的关系 | 漏掉项目成员关联实体;把成员关系简化成任务字段;实体关系图错误且影响理解 |
| RU-02 字段类型与约束还原 | 5 | 明确写出 role、priority、status 枚举;用户名 3-20 字符且唯一;密码不少于 6 位;标题 1-100 字符;描述不超过 500 字符 | 漏写枚举值;漏写长度限制;把约束只写成泛泛校验;最终代码实现了但 Plan 没写也不能补分 |
| RU-03 权限模型理解 | 4 |
A.1.2 功能设计 FD(20 分)
本阶段 Plan 为主,代码只用于验证设计是否兑现。Plan 没写的内容不能靠最终代码反向补满。
| 细项 | 分值 | 评分标准 | 典型扣分情况 |
|---|---|---|---|
| FD-01 API 设计 | 8 | Plan 中列出 12 个核心接口,包含方法、路径、鉴权、权限、关键请求/响应和错误码 | 接口数量不全;路径或方法不稳定;状态流转接口和前端实际调用不一致 |
| FD-02 E2E 设计 | 6 | 设计 E2E-01~E2E-15,覆盖登录、项目、邀请、任务 CRUD、状态流转、筛选、日历、readonly、响应式、部署访问 | 只有泛泛测试计划;未覆盖 readonly 或非法状态流转;未要求 Python Playwright 或 data-testid |
| FD-03 UT 设计 | 6 | 设计 UT-01~UT-21,覆盖认证、权限、字段约束、状态机、筛选、日历查询、种子数据 | 后端单测设计缺失;只测试 happy path;未覆盖 readonly 403 和非法状态流转 |
A.1.3 架构设计 AD(20 分)
本阶段 Plan 为主,代码和部署材料用于验证架构是否落地。
| 细项 | 分值 | 评分标准 | 典型扣分情况 |
|---|---|---|---|
| AD-01 技术栈选型 | 4 | 明确前后端、数据库、Docker、测试工具和约束,例如 FastAPI、React、PostgreSQL、原生 SQL/禁止 ORM 等 | 技术栈不清;选型与要求冲突;测试或部署工具缺失 |
| AD-02 DDL 与数据约束 | 5 | 给出四表 DDL,包含主键、外键、唯一约束、枚举 CHECK、时间字段、必要索引 | DDL 缺失;字段约束只写在文字里;缺少外键或枚举 CHECK |
| AD-03 分层与权限架构 | 4 | 说明后端 routers/services/repositories/deps/permissions 等边界,前端 API、页面、组件、状态分层清楚 | 核心逻辑堆在单文件;权限校验分散;SQL 和路由混杂 |
| AD-04 部署架构 | 4 | 说明 Docker Compose、前端/后端/数据库服务、volume、环境变量、端口、健康检查、UCloud 网络/防火墙 | 未说明 UCloud 防火墙;未说明健康检查;Docker 自启动或重启策略缺失 |
| AD-05 阶段拆分和交付物 | 3 | 有 Plan -> Build -> Test -> Deploy -> Acceptance 阶段拆分,每阶段有交付物或验收标准 | 阶段不清;没有验收口径;部署和测试混在一起 |
A.1.4 前端实现 FE(20 分)
本阶段看实际前端代码、页面行为、E2E 和人工检查结果。
| 细项 | 分值 | 评分标准 | 典型扣分情况 |
|---|---|---|---|
| FE-01 基础页面与导航 | 3 | 登录/注册、项目列表、项目详情、顶部导航、基础视觉规范可用 | 页面缺失;入口混乱;样式丢失 |
| FE-02 看板与任务卡 | 4 | 三列看板、列计数、任务卡字段、优先级、截止日期、状态推进按钮完整 | 任务字段缺失;状态按钮错误;标题溢出严重影响展示 |
| FE-03 任务与成员操作 | 3 | 创建/编辑/删除任务、邀请成员、成员列表或成员管理入口可用 | 缺少邀请功能;缺少成员管理组件;表单字段类型错误 |
| FE-04 筛选与日历 | 3 | 成员筛选、状态多选、视图切换保持筛选、日历月视图、任务详情弹窗可用 | 筛选类型错误;切换视图丢筛选;首次进入项目任务不加载 |
| FE-05 权限入口收敛 | 3 | readonly 用户隐藏邀请、创建、编辑、删除、状态推进等写入口 | 后端能 403 但前端仍显示写入口;readonly 可见状态推进按钮 |
| FE-06 动画与交互反馈 | 2 | FAB、任务进入、弹窗、按钮、Toast、删除动效符合要求 | 删除动画未触发;动画方向/距离不符合;反馈过浅 |
| FE-07 加载、空状态、错误提示 | 1 | Spinner、Toast、空状态、错误提示可见,加载时不白屏 | 首屏空白;错误无提示;刷新登录态丢失 |
| FE-08 响应式适配 | 1 | 移动端、中屏、桌面端布局稳定,文本不溢出、不遮挡 | 三断点不严格;长标题不换行;移动端布局只检查可见未检查可用 |
A.1.5 后端实现 BE(20 分)
本阶段看实际后端代码、接口行为、数据库结构和当前/历史验证结果。
| 细项 | 分值 | 评分标准 | 典型扣分情况 |
|---|---|---|---|
| BE-01 核心接口完整性 | 4 | 注册、登录、用户、项目、成员、任务 CRUD、health 等接口完整 | 登录路径 404;核心接口缺失;方法不匹配 |
| BE-02 状态流转校验 | 4 | 后端真实校验状态机,非法流转返回 400 | 只靠前端限制;done 直接回 todo;非法流转成功 |
| BE-03 权限校验 | 4 | readonly 写操作 403,非项目成员访问 403,edit 权限可写 | readonly 后端可写;非成员可访问;权限只在前端控制 |
| BE-04 鉴权机制 | 3 | JWT、Header 校验、过期/无效 token 401,除公开接口外均需鉴权 | token 不校验;接口裸奔;错误码混乱 |
| BE-05 字段约束落地 | 2 | 用户名、密码、role、priority、status、标题、描述等约束在路由/Pydantic/DDL 中落实 | 只在前端校验;DDL 无 CHECK;类型不一致导致 422 |
| BE-06 初始化与种子数据 | 2 | 数据库初始化、默认账号、示例项目、成员和任务幂等可用 | 默认账号不可用;种子数据缺失;重启后数据丢失 |
| BE-07 查询与日历支持 | 1 | 支持成员筛选、状态多选、截止日期范围或 year/month 等日历查询 | 查询参数缺失;只前端本地过滤;日历范围不可查 |
A.1.6 功能测试 TS(20 分)
本阶段看测试代码和测试运行结果,不能只看测试文件是否存在。
| 细项 | 分值 | 评分标准 | 典型扣分情况 |
|---|---|---|---|
| TS-01 E2E 工具和可运行性 | 4 | 使用 Python Playwright,使用 data-testid,支持 BASE_URL 指向云端 | E2E 不可运行;只能本地跑;定位器脆弱 |
| TS-02 E2E 覆盖和通过率 | 4 | E2E-01~E2E-15 覆盖完整,云端或本地实际通过 | 编号覆盖但断言浅;未跑云端;部署后使用时出现的 Bug 未覆盖 |
| TS-03 readonly/权限 E2E | 3 | 覆盖 readonly 写入口隐藏和后端 403 等关键权限场景 | 只断言一个按钮隐藏;未覆盖状态推进/编辑/删除 |
| TS-04 独立测试数据库 | 3 | UT 使用独立测试数据库,不污染生产数据,结构尽量同构 | 使用生产库;SQLite 替代 PostgreSQL 导致约束差异 |
| TS-05 UT 覆盖完整性 | 3 | UT-01~UT-21 覆盖认证、项目、成员、任务、筛选、日历 | 只测 happy path;缺少字段约束或筛选测试 |
| TS-06 风险点单测 | 3 | 覆盖非法状态流转、readonly 403、非成员 403 等风险点 | 测试未挡住 P1/P2 Bug;状态机没有单测 |
A.1.7 问题处理 PD(20 分)
| 细项 | 分值 | 评分标准 | 典型扣分情况 |
|---|---|---|---|
| PD-01 问题识别 | 8 | 能从日志、报错、接口返回中准确识别问题根因 | 反复试错但不定位;需要用户指出错误 |
| PD-02 修复闭环 | 8 | 给出正确修复并完成复测,能处理部署、防火墙、SSH、接口等问题 | 修复不完整;需要人工介入继续;修错方向 |
| PD-03 验证记录 | 4 | 记录复测命令、结果、默认账号、公网 health、E2E 等证据 | 只口头说完成;缺少复测记录 |
A.1.8 代码质量检查 CR(20 分)
| 细项 | 分值 | 评分标准 | 典型扣分情况 |
|---|---|---|---|
| CR-01 代码结构与可维护性 | 8 | 模块边界清楚,路由、权限、SQL、组件拆分合理 | 单文件堆叠;前后端接口约定混乱;重复逻辑多 |
| CR-02 安全与错误处理 | 7 | 密码哈希、JWT、安全配置、参数化 SQL、统一错误处理较好 | 明文密码;SQL 注入风险;敏感信息硬编码 |
| CR-03 接口约定一致性与细节质量 | 5 | 前后端字段、路径、状态、错误码一致,UI 细节和测试口径可靠 | API 路径 404/405;字段类型不一致;视觉/响应式细节明显偏差 |
A.1.9 UCloud 部署 DP(20 分)
| 细项 | 分值 | 评分标准 | 典型扣分情况 |
|---|---|---|---|
| DP-01 UCloud CLI 创建资源 | 2 | 能用 UCloud CLI 创建云服务器和公网 IP,并说明关键参数 | 创建失败;命令缺失;需要用户手动创建 |
| DP-02 资源信息记录 | 2 | 记录 UHostId、EIPId、公网 IP、Region/Zone、防火墙等 | 资源记录混乱;缺少公网 IP、UHostId 或防火墙信息 |
| DP-03 SSH 登录和服务器连接 | 3 | 能识别 Ubuntu 镜像登录用户,正确使用 ubuntu@IP + sudo 连接和部署 | 反复使用 root 登录;SSH 阻塞;需要用户确认后继续 |
| DP-04 防火墙和公网端口 | 4 | 正确配置 UCloud 防火墙/安全组,放行前端和后端访问端口 | 忘记配置防火墙;公网无法访问;端口策略不清 |
| DP-05 Docker Compose 部署 | 3 | 前端、后端、PostgreSQL 三服务,volume、环境变量、端口映射和构建流程正确 | 服务缺失;配置错误;Docker 安装或构建不稳定 |
| DP-06 公网功能验收 | 3 | 前端 HTTP 200,后端 health 可用,默认账号可登录,种子数据存在,关键 API/E2E 通过 | 页面能打开但核心功能报错;health/API 不可用 |
| DP-07 重启恢复能力 | 2 | 服务器关机再开机后,Docker 和业务服务能自动恢复 | Docker 不自启动;重启后服务不可用;需要人工再部署 |
| DP-08 调试和清理说明 | 1 | README/scripts 提供日志查看、问题排查和资源清理说明,删除资源需确认 | 无清理说明;清理脚本危险;部署不可恢复 |
A.1.10 质量分(20 分) 质量分基于 Bug 和实现偏差综合判断,按 20 分直接打分。
| 等级 | 说明 | 典型问题 | 影响 |
|---|---|---|---|
| P1 | 核心业务逻辑或部署不可用 | readonly 后端写操作成功;非法状态流转成功;公网无法访问;登录主流程完全失败 | 严重影响交付,质量分大幅扣分 |
| P2 | 重要需求偏差或核心交互失败 | 前端缺少邀请/成员管理;状态流转 405;任务编辑 422;刷新登录态丢失;首次项目页任务不加载 | 明显影响用户检查和上线判断,按数量和范围扣分 |
| P3 | 中低风险偏差 | 动画不符合、响应式断点不严格、长标题溢出、测试断言偏浅 | 不一定阻断主流程,但影响完整度和专业度 |
附录 B:各模型阶段评分备注 本附录的阶段得分、附录 C 的细项矩阵、附录 D 的扣分明细均采用同一套 20 分制。 B.0 GLM 5.2
| 指标 | 结果 |
|---|---|
| 综合分 | 189/200 |
| 质量分 | 17/20 |
| 最终时长 | 1h55m25s |
| 实际费用 | ¥50.74 |
| Token 总数 | 16.62M |
| 对话消息总次数 | 205 |
| 人工介入次数 | 0 |
| 阶段 | 展示满分 | 得分 | 得分备注 |
|---|---|---|---|
| 需求理解 | 20 | 20 | Plan 文档完整还原实体、字段约束、权限、状态机、筛选/日历 |
| 功能设计 | 20 | 20 | 12 个 API、E2E-01 |
| 架构设计 | 20 | 18 | 架构、DDL、Docker、UCloud 完整;扣 Plan/README 仍写 root SSH 口径 |
| 前端实现 | 20 | 17 | 看板、日历、筛选、邀请、权限入口基本完整;扣首页缺少注册入口、删除动画细节和长文本标题溢出 |
| 后端实现 | 20 | 20 | 认证、权限、状态机、字段约束、筛选、种子数据完整 |
| 功能测试 | 20 | 19 | 后端 23 个单测、本地和云端 E2E 15/15 通过;扣少量断言偏浅 |
| 问题处理 | 20 | 20 | 开发、测试、部署问题均独立定位并闭环 |
| 代码质量检查 | 20 | 18 | 分层清晰;扣部署元数据敏感字段和 SSH 文档口径 |
| UCloud 部署验收 | 20 | 20 | UCloud 创建、Docker、防火墙、公网验收、云端 E2E 均完成 |
主要扣分点:首页只显示登录入口、没有注册入口;长文本标题溢出;Plan/README 中保留 root@IP,实际部署靠 ubuntu 用户完成;E2E 少量断言偏浅;deploy-meta.json 含 SSH 密码字段,正式项目需要更严格的敏感信息治理。 B.1 ChatGPT 5.5
| 指标 | 结果 |
|---|---|
| 综合分 | 182/200 |
| 质量分 | 16/20 |
| 最终时长 | 1h41m03s |
| 实际费用 | ¥223.01 |
| Token 总数 | 11.16M |
| 对话消息总次数 | 84 |
| 人工介入次数 | 1 |
| 阶段 | 展示满分 | 得分 | 得分备注 |
|---|---|---|---|
| 需求理解 | 20 | 20 | Plan 文档完整还原实体、字段约束、权限、状态机、筛选/日历 |
| 功能设计 | 20 | 20 | Plan 输出完整设计 12 个 API、E2E-01 |
| 架构设计 | 20 | 16 | Plan 架构很完整;实际代码未按 Plan 的 routes/repositories/permissions 分层充分落地 |
| 前端实现 | 20 | 18 | 主流程、权限收敛、看板/日历/筛选完整;扣删除动画、中屏紧凑响应式和长标题溢出 |
| 后端实现 | 20 | 20 | 认证、权限、状态机、字段校验、筛选、种子数据和统一响应完整 |
| 功能测试 | 20 | 19 | UT 21/21、E2E 15/15 通过;扣 E2E-09/13/14 断言偏浅 |
| 问题处理 | 20 | 20 | 部署中定位并解决 SSH 用户、Docker 拉取、防火墙公网访问等问题 |
| 代码质量检查 | 20 | 15 | 安全和参数化较好;扣单文件后端、测试数据库替代口径、E2E 深度、视觉细节 |
| UCloud 部署验收 | 20 | 18 | UCloud CLI 创建、资源记录、SSH、防火墙、Docker、公网验收和清理说明完成;扣分点是第一次交付没有独立实现部署断点重启/重启恢复能力 |
主要扣分点:后端核心逻辑集中在单文件、E2E 关键风险断言偏浅、删除动画未真正实现、中屏紧凑样式缺失、长标题溢出、部署断点重启需要人工介入。 B.2 Claude Opus 4.8
| 指标 | 结果 |
|---|---|
| 综合分 | 186/200 |
| 质量分 | 15/20 |
| 最终时长 | 1h28m09s |
| 实际费用 | ¥808.18 |
| Token 总数 | 19.82M |
| 对话消息总次数 | 171 |
| 人工介入次数 | 0 |
| 阶段 | 展示满分 | 得分 | 得分备注 |
|---|---|---|---|
| 需求理解 | 20 | 20 | 方案完整识别实体、字段、权限、状态机、筛选/日历细节 |
| 功能设计 | 20 | 20 | 12 个接口、E2E-01 |
| 架构设计 | 20 | 18 | 架构和部署拆分完整;固定安全组不放行 80/3000,实际靠额外防火墙修正 |
| 前端实现 | 20 | 16 | 主流程完整;扣 readonly 状态推进按钮仍可见、严格三断点不足、动画偏差和长标题溢出 |
| 后端实现 | 20 | 19 | 权限/状态机/认证/种子/接口完整;扣缺少 year/month 日历查询接口参数 |
| 功能测试 | 20 | 20 | UT 21/21,E2E 15/15,当前云端复跑 E2E 15/15 |
| 问题处理 | 20 | 20 | 部署中定位并解决 ubuntu 登录、防火墙、Docker Hub 拉取慢等问题 |
| 代码质量检查 | 20 | 18 | SQL 参数化、bcrypt、统一响应较好;扣前后端权限收敛一致性和少量实现细节 |
| UCloud 部署验收 | 20 | 20 | UHost/EIP/公网 IP/防火墙/公网验收/E2E 均完成,能处理 ubuntu 登录和防火墙问题 |
主要扣分点:readonly 用户前端仍显示状态推进按钮、后端缺少 year/month 查询参数、响应式断点不严格、动画实现偏离需求、长标题溢出。
B.3 GLM 5.1
| 指标 | 结果 |
|---|---|
| 综合分 | 151/200 |
| 质量分 | 10/20 |
| 最终时长 | 1h31m45s |
| 实际费用 | ¥63.71 |
| Token 总数 | 21.38M |
| 对话消息总次数 | 167 |
| 人工介入次数 | 2 |
| 阶段 | 展示满分 | 得分 | 得分备注 |
|---|---|---|---|
| 需求理解 | 20 | 20 | Plan 文档完整覆盖字段、权限、状态机、筛选/日历 |
| 功能设计 | 20 | 20 | API/E2E/UT 设计完整 |
| 架构设计 | 20 | 18 | 后端分层完整;部署 SSH 用户口径有风险 |
| 前端实现 | 20 | 14 | 功能组件较全;首次进入项目任务不加载、样式丢失、登录态问题扣分 |
| 后端实现 | 20 | 19 | 后端结构和约束较完整 |
| 功能测试 | 20 | 16 | E2E 文件覆盖 15 项;未挡住首屏任务加载和样式问题 |
| 问题处理 | 20 | 10 | bash tool schema 错误和前端样式问题需人工介入 |
| 代码质量检查 | 20 | 13 | 结构较好,但前端 effect 依赖和部署脚本问题明显 |
| UCloud 部署验收 | 20 | 11 | 有公网 IP 记录,但 SSH 用户口径、部署脚本、前端样式和页面加载问题影响验收 |
主要扣分点:首次进入项目页任务不会加载、前端样式丢失、刷新页面登录信息未保存、部署脚本 root 登录和校验命令风险。
B.4 Qwen3.7 Max
| 指标 | 结果 |
|---|---|
| 综合分 | 148/200 |
| 质量分 | 10/20 |
| 最终时长 | 1h54m34s |
| 实际费用 | ¥148.27 |
| Token 总数 | 24.93M |
| 对话消息总次数 | 210 |
| 人工介入次数 | 2 |
| 阶段 | 展示满分 | 得分 | 得分备注 |
|---|---|---|---|
| 需求理解 | 20 | 17 | 核心需求覆盖;ER 图 Mermaid 解析失败扣分 |
| 功能设计 | 20 | 18 | API/E2E/UT 设计较完整 |
| 架构设计 | 20 | 16 | 分层较好;部署与前后端接口一致性有风险 |
| 前端实现 | 20 | 14 | 主要功能存在;状态流转接口和邀请功能在实际测评中失败 |
| 后端实现 | 20 | 18 | 状态机和权限基本实现;接口方法与前端部署后调用不一致 |
| 功能测试 | 20 | 16 | UT/E2E 文件完整,但未挡住 405 和邀请缺失问题 |
| 问题处理 | 20 | 13 | 有人工介入,最终问题记录明确 |
| 代码质量检查 | 20 | 13 | 结构尚可,但接口一致性和页面检查不足 |
| UCloud 部署验收 | 20 | 13 | 有公网访问记录,但状态流转 405、邀请功能缺失,Docker 重启策略和部署一致性不足 |
主要扣分点:Mermaid ER 图解析失败、状态流转接口 405、前端页面缺少邀请功能、测试没有提前发现部署后的使用问题。
B.5 Deepseek V4 Pro
| 指标 | 结果 |
|---|---|
| 综合分 | 146/200 |
| 质量分 | 9/20 |
| 最终时长 | 2h43m43s |
| 实际费用 | ¥39.70 |
| Token 总数 | 49.23M |
| 对话消息总次数 | 259 |
| 人工介入次数 | 4 |
| 阶段 | 展示满分 | 得分 | 得分备注 |
|---|---|---|---|
| 需求理解 | 20 | 18 | 核心需求完整;API 前缀口径略不清 |
| 功能设计 | 20 | 18 | API/E2E/UT 设计完整;日历查询设计偏弱 |
| 架构设计 | 20 | 18 | 前后端分层较好,Docker restart 较完整 |
| 前端实现 | 20 | 13 | 多个核心前端 Bug:登录路径、assignee 类型、重新打开状态、成员管理 |
| 后端实现 | 20 | 18 | 后端功能较完整,状态机能拦截非法流转 |
| 功能测试 | 20 | 16 | 测试文件较全,但没有提前发现部署后的前端 Bug |
| 问题处理 | 20 | 10 | 多次人工介入,断点重启需用户介入 |
| 代码质量检查 | 20 | 13 | 结构好,但前后端接口约定和部署流程质量不足 |
| UCloud 部署验收 | 20 | 13 | 公网可测,Docker restart 较完整,但登录、任务编辑和重新打开等核心交互出错,断点重启需人工介入 |
主要扣分点:assignee_id 提交字符串导致 422、登录接口 /api/login 404、重新打开功能目标状态错误、前端缺少成员管理组件、部署断点重启需人工介入。 B.6 Kimi K2.6
指标 结果 综合分 136/200 质量分 8/20 最终时长 3h43m37s 实际费用 ¥42.45 Token 总数 23.76M 对话消息总次数 291 人工介入次数 3 阶段 展示满分 得分 得分备注 需求理解 20 17 基本覆盖核心需求;扣部分约束表达不完整,部署登录方式仍写 root 功能设计 20 18 API/E2E/UT 设计完整,但 UCloud SSH 设计有明显风险 架构设计 20 16 前后端和后端分层较完整;部署架构和资源记录混乱扣分 前端实现 20 16 看板/日历/邀请/筛选基本实现;筛选类型、响应式/动画细节有偏差 后端实现 20 18 FastAPI、权限、状态机、种子数据基本完整 功能测试 20 16 有 UT/E2E 设计和测试文件;未见充分当前复跑证据,部署重启问题未覆盖 问题处理 20 10 多次人工介入;SSH、防火墙、资源选择问题未能独立闭环 代码质量检查 20 10 功能代码尚可,但部署脚本存在 root 登录、安全边界和资源治理问题 UCloud 部署验收 20 7 有公网 IP/UHost 记录,但 SSH、防火墙、资源使用和重启自恢复问题严重
主要扣分点:SSH 登录阻塞、创建资源失败后未提示用户就改用其他服务器、有安全风险、默认未配置 UCloud 防火墙、服务器关机开机后 Docker 未自启动。 附录 C:细项评分矩阵 下面矩阵用于回答“每个阶段具体扣在哪里”。所有细项和小计均采用 20 分制,细项含义见附录 A。 C.1 需求、设计与架构细项
细项 满分 GLM 5.2 ChatGPT 5.5 Claude Opus 4.8 GLM 5.1 Qwen3.7 Max Deepseek V4 Pro Kimi K2.6 RU-01 实体与关系识别 5 5 5 5 5 2 5 5 RU-02 字段类型与约束还原 5 5 5 5 5 5 5 3 RU-03 权限模型理解 4 4 4 4 4 4 2 3 RU-04 状态机理解 4 4 4 4 4 4 4 4 RU-05 筛选与日历理解 2 2 2 2 2 2 2 2 RU 小计 20 20 20 20 20 17 18 17 FD-01 API 设计 8 8 8 8 8 6 6 8 FD-02 E2E 设计 6 6 6 6 6 6 6 6 FD-03 UT 设计 6 6 6 6 6 6 6 4 FD 小计 20 20 20 20 20 18 18 18 AD-01 技术栈选型 4 4 4 4 4 4 4 4 AD-02 DDL 与数据约束 5 5 5 5 5 3 5 3 AD-03 分层与权限架构 4 4 2 4 4 4 4 4 AD-04 部署架构 4 2 4 4 2 2 2 2 AD-05 阶段拆分和交付物 3 3 1 1 3 3 3 3 AD 小计 20 18 16 18 18 16 18 16
C.2 前端、后端与测试细项
| 细项 | 满分 | GLM 5.2 | ChatGPT 5.5 | Claude Opus 4.8 | GLM 5.1 | Qwen3.7 Max | Deepseek V4 Pro | Kimi K2.6 |
|---|---|---|---|---|---|---|---|---|
| FE-01 基础页面与导航 | 3 | 2 | 3 | 3 | 1 | 3 | 1 | 3 |
| FE-02 看板与任务卡 | 4 | 4 | 4 | 4 | 3 | 3 | 3 | 4 |
| FE-03 任务与成员操作 | 3 | 3 | 3 | 3 | 3 | 0 | 2 | 3 |
| FE-04 筛选与日历 | 3 | 3 | 3 | 3 | 2 | 3 | 2 | 1 |
| FE-05 权限入口收敛 | 3 | 3 | 3 | 1 | 3 | 2 | 2 | 3 |
| FE-06 动画与交互反馈 | 2 | 1 | 1 | 1 | 1 | 1 | 1 | 1 |
| FE-07 加载、空状态、错误提示 | 1 | 1 | 1 | 1 | 0 | 1 | 1 | 1 |
| FE-08 响应式适配 | 1 | 0 | 0 | 0 | 1 | 1 | 1 | 0 |
| FE 小计 | 20 | 17 | 18 | 16 | 14 | 14 | 13 | 16 |
| BE-01 核心接口完整性 | 4 | 4 | 4 | 4 | 4 | 3 | 3 | 4 |
| BE-02 状态流转校验 | 4 | 4 | 4 | 4 | 4 | 4 | 4 | 4 |
| BE-03 权限校验 | 4 | 4 | 4 | 4 | 4 | 4 | 4 | 4 |
| BE-04 鉴权机制 | 3 | 3 | 3 | 3 | 3 | 3 | 3 | 3 |
| BE-05 字段约束落地 | 2 | 2 | 2 | 2 | 2 | 2 | 1 | 1 |
| BE-06 初始化与种子数据 | 2 | 2 | 2 | 2 | 2 | 1 | 2 | 1 |
| BE-07 查询与日历支持 | 1 | 1 | 1 | 0 | 0 | 1 | 1 | 1 |
| BE 小计 | 20 | 20 | 20 | 19 | 19 | 18 | 18 | 18 |
| TS-01 E2E 工具和可运行性 | 4 | 4 | 4 | 4 | 4 | 4 | 4 | 4 |
| TS-02 E2E 覆盖和通过率 | 4 | 3 | 4 | 4 | 2 | 2 | 2 | 2 |
| TS-03 readonly/权限 E2E | 3 | 3 | 2 | 3 | 3 | 2 | 2 | 2 |
| TS-04 独立测试数据库 | 3 | 3 | 3 | 3 | 2 | 3 | 3 | 3 |
| TS-05 UT 覆盖完整性 | 3 | 3 | 3 | 3 | 3 | 3 | 3 | 3 |
| TS-06 风险点单测 | 3 | 3 | 3 | 3 | 2 | 2 | 2 | 2 |
| TS 小计 | 20 | 19 | 19 | 20 | 16 | 16 | 16 | 16 |
C.3 问题处理、代码质量与部署细项
| 细项 | 满分 | GLM 5.2 | ChatGPT 5.5 | Claude Opus 4.8 | GLM 5.1 | Qwen3.7 Max | Deepseek V4 Pro | Kimi K2.6 |
|---|---|---|---|---|---|---|---|---|
| PD-01 问题识别 | 8 | 8 | 8 | 8 | 1 | 4 | 1 | 1 |
| PD-02 修复闭环 | 8 | 8 | 8 | 8 | 5 | 5 | 5 | 5 |
| PD-03 验证记录 | 4 | 4 | 4 | 4 | 4 | 4 | 4 | 4 |
| PD 小计 | 20 | 20 | 20 | 20 | 10 | 13 | 10 | 10 |
| CR-01 代码结构与可维护性 | 8 | 8 | 5 | 8 | 5 | 6 | 6 | 3 |
| CR-02 安全与错误处理 | 7 | 5 | 5 | 7 | 5 | 2 | 2 | 2 |
| CR-03 接口约定一致性与细节质量 | 5 | 5 | 5 | 3 | 3 | 5 | 5 | 5 |
| CR 小计 | 20 | 18 | 15 | 18 | 13 | 13 | 13 | 10 |
| DP-01 UCloud CLI 创建资源 | 2 | 2 | 2 | 2 | 2 | 2 | 2 | 1 |
| DP-02 资源信息记录 | 2 | 2 | 2 | 2 | 2 | 2 | 2 | 2 |
| DP-03 SSH 登录和服务器连接 | 3 | 3 | 3 | 3 | 0 | 2 | 1 | 0 |
| DP-04 防火墙和公网端口 | 4 | 4 | 4 | 4 | 2 | 3 | 3 | 0 |
| DP-05 Docker Compose 部署 | 3 | 3 | 3 | 3 | 2 | 0 | 2 | 2 |
| DP-06 公网功能验收 | 3 | 3 | 3 | 3 | 2 | 2 | 2 |
| 模型 | 质量分 | P1/P2/P3 摘要 |
|---|---|---|
| GLM 5.2 | 17/20 | 无 P1/P2;P3 为首页缺少注册入口、长标题溢出、删除动画证据偏弱和敏感部署元数据治理 |
| ChatGPT 5.5 | 16/20 | 无 P1;P2 为架构落地偏离和 E2E 关键风险断言偏浅;P3 为删除动画、中屏样式、长标题溢出、测试数据库同构性 |
| Claude Opus 4.8 | 15/20 | 无 P1;P2 为 readonly 前端写入口、year/month 查询缺口;P3 为响应式、动画、长标题溢出、E2E 响应式断言浅 |
| GLM 5.1 | 10/20 | 多个 P2:首次项目页任务不加载、前端样式丢失、刷新登录态失败;P3 为部署脚本风险 |
| Qwen3.7 Max | 10/20 | P2:状态流转接口 405、邀请功能部署验收缺失;需求阶段 ER 图解析失败 |
| Deepseek V4 Pro | 9/20 | 多个 P2:assignee 类型 422、登录 404、重新打开状态错误、成员管理缺失、断点重启人工介入 |
| Kimi K2.6 | 8/20 | 部署安全/治理风险突出:SSH 阻塞、抢用其它服务器、防火墙缺失、Docker 重启后不自启动 |
附录 D:小项扣分明细
本附录只列没有拿满分的小项。所有“满分、得分、扣分”均采用 20 分制细项分;未列出的小项表示本轮证据支持满分。详细依据可继续查看各模型的 auditable-score.md。
D.0 GLM 5.2
| 小项 | 满分 | 得分 | 扣分 | 扣分依据 |
|---|---|---|---|---|
| AD-04 部署架构 | 4 | 2 | 2 | Plan 和 README 多处写 ssh root@<IP>;实际 session 中用户提示后改用 ubuntu 才完成 SSH。 |
| FE-01 基础页面与导航 | 3 | 2 | 1 | 首页页面只有登录按钮,无法直接切换到注册页面;实际 /register 页面存在且可正常注册。 |
| FE-06 动画与交互反馈 | 2 | 1 | 1 | 前端实现了 FAB、弹窗、Toast、任务进入动画,但删除流程主要是确认弹窗,未充分证明“任务卡 scale 1→0.8 + opacity 1→0”的删除动画闭环。 |
| FE-08 响应式适配 | 1 | 0 | 1 | 人工验收发现长文本标题溢出容器,文本保护不足。 |
| TS-02 E2E 覆盖和通过率 | 4 | 3 | 1 | E2E 本地和云端均 15/15 通过,但部分用例只断言页面可见或列存在,例如成员筛选、状态筛选、响应式断言偏浅。 |
| CR-02 安全与错误处理 | 7 | 5 | 2 | deploy-meta.json 记录了 SSH 密码字段;虽然便于部署追踪,但作为项目产物存在敏感信息治理风险。 |
D.1 ChatGPT 5.5
| 小项 | 满分 | 得分 | 扣分 | 扣分依据 |
|---|---|---|---|---|
| AD-03 分层与权限架构 | 4 | 2 | 2 | Plan 设计 routes/、repositories/、permissions.py 等分层,但实际核心路由、权限和 SQL 大量集中在 backend/app/main.py。 |
| AD-05 阶段拆分和交付物 | 3 | 1 | 2 | Plan 前端建议拆分 API/state/components/styles/e2e 多目录,但实际前端核心业务集中在 frontend/src/App.jsx。 |
| FE-06 动画与交互反馈 | 2 | 1 | 1 | 删除只用 window.confirm 后直接刷新,没有实现要求的 scale/opacity 删除确认动画。 |
| FE-08 响应式适配 | 1 | 0 | 1 | 768-1023 中屏没有单独实现“三列并排、卡片信息紧凑显示”的样式。 |
| TS-03 readonly/权限 E2E | 3 | 2 | 1 | readonly E2E 只断言邀请按钮隐藏,没有覆盖创建、编辑、删除、状态推进全部写入口。 |
| CR-01 代码结构与可维护性 | 8 | 5 | 3 | 后端核心业务集中在单文件,和 Plan 的 repository/route/permission 分层不一致。 |
| CR-02 安全与错误处理 | 7 | 5 | 2 | 测试环境用 SQLite 替代 PostgreSQL,和“生产与测试同结构/独立数据库”口径不完全一致。 |
| DP-07 重启恢复能力 | 2 | 0 | 2 | 人工记录显示“部署支持断点重启”需要人工介入。按“第一次没实现就是 0 分”的口径,该项不得分。 |
D.2 Claude Opus 4.8
| 小项 | 满分 | 得分 | 扣分 | 扣分依据 |
|---|---|---|---|---|
| AD-05 阶段拆分和交付物 | 3 | 1 | 2 | 部署架构整体完整,但最初固定安全组不放行 80/3000,实际靠额外防火墙修正,存在方案/执行偏差。 |
| FE-05 权限入口收敛 | 3 | 1 | 2 | readonly 用户隐藏了邀请、添加、编辑、删除,但状态推进按钮仍无条件显示。 |
| FE-06 动画与交互反馈 | 2 | 1 | 1 | 任务切列动画方向/距离不符合需求,删除动画定义后未实际套到任务卡删除流程。 |
| FE-08 响应式适配 | 1 | 0 | 1 | 未严格区分 768-1023 和 >=1024 两个并排断点,也没有卡片紧凑模式。 |
| BE-07 查询与日历支持 | 1 | 0 | 1 | 后端缺少明确的 year/month 日历查询接口参数,只能通过其它查询方式间接满足。 |
| CR-03 接口约定一致性与细节质量 | 5 | 3 | 2 | readonly 前端仍展示状态推进写入口,日历查询参数缺口和响应式测试偏浅。 |
D.3 GLM 5.1
| 小项 | 满分 | 得分 | 扣分 | 扣分依据 |
|---|---|---|---|---|
| AD-04 部署架构 | 4 | 2 | 2 | Plan 和部署脚本偏向 ssh root@<IP>,对本轮 UCloud Ubuntu 镜像不稳。 |
| FE-01 基础页面与导航 | 3 | 1 | 2 | 人工记录显示前端样式丢失,基础页面可用性和视觉验收受影响。 |
| FE-02 看板与任务卡 | 4 | 3 | 1 | 首次进入项目页任务不会加载,影响看板首屏任务展示。 |
| FE-04 筛选与日历 | 3 | 2 | 1 | 首次进入项目任务不加载会连带影响筛选/日历首屏数据展示。 |
| FE-06 动画与交互反馈 | 2 | 1 | 1 | 前端样式丢失后,交互反馈和动画验收不可靠。 |
| FE-07 加载、空状态、错误提示 | 1 | 0 | 1 | 首次进入项目页任务不加载,缺少足够清晰的加载/错误闭环。 |
| BE-07 查询与日历支持 | 1 | 0 | 1 | 后端日历查询支持证据不足,测试未能挡住首屏任务加载问题。 |
| TS-02 E2E 覆盖和通过率 | 4 | 2 | 2 | E2E 文件覆盖 15 项,但没有发现样式丢失和首次项目页任务不加载。 |
| TS-04 独立测试数据库 | 3 | 2 | 1 | 独立测试数据库和生产同构性证据不足。 |
| TS-06 风险点单测 | 3 | 2 | 1 | 测试未覆盖前端首屏任务加载、刷新登录态和样式部署风险。 |
| PD-01 问题识别 | 8 | 1 | 7 | bash tool schema 错误、前端样式丢失等问题需要人工指出或推动。 |
| PD-02 修复闭环 | 8 | 5 | 3 | 前端样式和页面加载问题没有形成模型独立修复闭环。 |
| CR-01 代码结构与可维护性 | 8 | 5 | 3 | 前端 effect 依赖缺陷导致首次进入项目任务不会加载。 |
| CR-02 安全与错误处理 | 7 | 5 | 2 | 部署脚本 root 登录和校验命令存在风险。 |
| CR-03 接口约定一致性与细节质量 | 5 | 3 | 2 | 前端样式、登录态和首屏数据加载问题影响整体交付细节。 |
| DP-03 SSH 登录和服务器连接 | 3 | 0 | 3 | SSH 用户口径有风险,脚本偏向 root 登录。 |
| DP-04 防火墙和公网端口 | 4 | 2 | 2 | 公网部署验收受前端样式和页面加载问题影响,防火墙/公网端口闭环证据不足。 |
| DP-05 Docker Compose 部署 | 3 | 2 | 1 | 部署脚本和校验命令存在风险,Docker 部署链路不够稳。 |
| DP-06 公网功能验收 | 3 | 2 | 1 | 前端样式丢失、首次项目页任务不加载,公网功能验收不完整。 |
| DP-07 重启恢复能力 | 2 | 0 | 2 | 重启恢复能力证据不足,且未证明服务器重启后业务服务能自动恢复。 |
D.4 Qwen3.7 Max
| 小项 | 满分 | 得分 | 扣分 | 扣分依据 |
|---|---|---|---|---|
| RU-01 实体与关系识别 | 5 | 2 | 3 | Mermaid ER 图因 UNIQUE(project_id, user_id) 写法解析失败,影响需求文档实体关系可读性。 |
| FD-01 API 设计 | 8 | 6 | 2 | 状态流转接口设计和部署后前端实际调用不一致,出现 405。 |
| AD-02 DDL 与数据约束 | 5 | 3 | 2 | ER/DDL 表达存在 Mermaid 解析失败问题,数据约束文档可审计性不足。 |
| AD-04 部署架构 | 4 | 2 | 2 | Docker Compose 缺少 restart 策略,部署稳定性不如其它模型。 |
| FE-02 看板与任务卡 | 4 | 3 | 1 | 状态流转接口 405,任务状态修改主流程失败。 |
| FE-03 任务与成员操作 | 3 | 0 | 3 | 人工测评记录前端页面缺少用户邀请功能,无法邀请其他用户加入项目。 |
| FE-05 权限入口收敛 | 3 | 2 | 1 | 邀请功能实际不可用,权限相关入口和验收不完整。 |
| FE-06 动画与交互反馈 | 2 | 1 | 1 | 核心状态修改失败,交互反馈验收不完整。 |
| BE-01 核心接口完整性 | 4 | 3 | 1 | 部署后状态流转接口返回 405,接口方法或路径不一致。 |
| BE-06 初始化与种子数据 | 2 | 1 | 1 | 公网核心功能验收失败,种子数据和成员协作链路验证不完整。 |
| TS-02 E2E 覆盖和通过率 | 4 | 2 | 2 | 测试没有发现部署后的状态流转 405。 |
| TS-03 readonly/权限 E2E | 3 | 2 | 1 | 邀请/成员相关权限功能缺失,权限 E2E 验收不足。 |
| TS-06 风险点单测 | 3 | 2 | 1 | 测试未挡住接口方法不一致和邀请功能缺失。 |
| PD-01 问题识别 | 8 | 4 | 4 | ER 图解析错误、状态流转 405 需要人工介入暴露。 |
| PD-02 修复闭环 | 8 | 5 | 3 | 状态流转 405 和邀请缺失没有形成独立闭环。 |
| CR-01 代码结构与可维护性 | 8 | 6 | 2 | 部署产物与源码/接口设计存在不一致风险。 |
| CR-02 安全与错误处理 | 7 | 2 | 5 | 接口方法错误和关键功能缺失说明错误处理及验收不足。 |
| DP-03 SSH 登录和服务器连接 | 3 | 2 | 1 | 部署能推进,但人工介入后才暴露/处理部分问题。 |
| DP-04 防火墙和公网端口 | 4 | 3 | 1 | 公网能访问,但核心状态流转接口不可用,端到端验收不足。 |
| DP-05 Docker Compose 部署 | 3 | 0 | 3 | Compose 缺少 restart 策略,部署产物与接口行为不一致。 |
| DP-06 公网功能验收 | 3 | 2 | 1 | 状态流转 405、邀请功能缺失,公网验收不完整。 |
| DP-07 重启恢复能力 | 2 | 1 | 1 | 重启恢复能力证据不足,只能给部分分。 |
D.5 Deepseek V4 Pro
D.6 Kimi K2.6
| 小项 | 满分 | 得分 | 扣分 | 扣分依据 |
|---|---|---|---|---|
| RU-03 权限模型理解 | 4 | 2 | 2 | API 前缀和登录路径口径略不清,和后续 /api/login 404 有<span>关联风险</span>。 |
| FD-01 API 设计 | 8 | 6 | 2 | API 前缀/登录路径设计不够稳定,部署后出现 /api/login 404。 |
| AD-04 部署架构 | 4 | 2 | 2 | 部署断点重启需要人工介入,部署架构闭环不足。 |
| FE-01 基础页面与导航 | 3 | 1 | 2 | 登录接口 /api/login 404,登录主流程在实际访问中失败过。 |
| FE-02 看板与任务卡 | 4 | 3 | 1 | “重新打开”目标状态错误,请求 done -> todo 被后端拒绝。 |
| FE-03 任务与成员操作 | 3 | 2 | 1 | 前端缺少成员管理组件/入口,任务编辑 assignee 类型也出错。 |
| FE-04 筛选与日历 | 3 | 2 | 1 | assignee 字段类型前后端不一致,成员相关筛选/编辑可靠性不足。 |
| FE-05 权限入口收敛 | 3 | 2 | 1 | 成员管理入口缺失,权限相关前端能力不完整。 |
| FE-06 动画与交互反馈 | 2 | 1 | 1 | 多个核心交互报错,反馈和交互闭环不足。 |
| BE-01 核心接口完整性 | 4 | 3 | 1 | 前端请求 /api/login 404,登录路径和部署代理口径不一致。 |
| BE-05 字段约束落地 | 2 | 1 | 1 | assignee_id 前端提交字符串导致后端 422,前后端字段类型约定不一致。 |
| TS-02 E2E 覆盖和通过率 | 4 | 2 | 2 | 测试未发现登录 404、assignee 类型错误和重新打开状态错误。 |
| TS-03 readonly/权限 E2E | 3 | 2 | 1 | 成员管理/权限入口实际缺失,权限 E2E 覆盖不足。 |
| TS-06 风险点单测 | 3 | 2 | 1 | 测试未挡住状态目标错误和前后端字段类型错误。 |
| PD-01 问题识别 | 8 | 1 | 7 | 422、404、重新打开状态错误、断点重启均由人工介入暴露。 |
| PD-02 修复闭环 | 8 | 5 | 3 | 多个核心问题没有模型独立闭环,断点重启也需人工介入。 |
| CR-01 代码结构与可维护性 | 8 | 6 | 2 | 虽然模块化较好,但前后端路径和字段约定维护质量不足。 |
| CR-02 安全与错误处理 | 7 | 2 | 5 | 登录 404、任务编辑 422 等错误在交付前未被拦截。 |
| DP-03 SSH 登录和服务器连接 | 3 | 1 | 2 | 部署支持断点重启需要人工介入,连接/恢复闭环不足。 |
| DP-04 防火墙和公网端口 | 4 | 3 | 1 | 公网可测,但登录、任务编辑、重新打开等核心交互出错。 |
| DP-05 Docker Compose 部署 | 3 | 2 | 1 | Docker restart 较完整,但部署后核心交互仍暴露问题。 |
| DP-06 公网功能验收 | 3 | 2 | 1 | 公网验收暴露登录 404、任务编辑 422、状态错误。 |
| DP-07 重启恢复能力 | 2 | 0 | 2 | 部署断点重启需人工介入,不能计入模型独立完成。 |
附录 E:问题数量明细
本附录补充说明主表中的 人工验收问题数 和 开发自修 Bug 数。
E.1 人工验收问题数
人工验收问题数只统计交付后由人工验收、人工记录或用户测评过程中明确指出的问题;模型在开发过程中自己发现并修掉的问题不放在这里。
| 小项 | 满分 | 得分 | 扣分 | 扣分依据 |
|---|---|---|---|---|
| RU-02 字段类型与约束还原 | 5 | 3 | 2 | 描述字段在 DDL 中写为 TEXT,没有体现 500 字符限制。 |
| RU-03 权限模型理解 | 4 | 3 | 1 | 部署登录方式仍写 root,说明对 UCloud 部署约束理解不完整。 |
| FD-03 UT 设计 | 6 | 4 | 2 | UT 设计存在,但部署重启恢复风险没有纳入测试闭环。 |
| AD-02 DDL 与数据约束 | 5 | 3 | 2 | 描述长度等约束没有在 DDL 层充分体现。 |
| AD-04 部署架构 | 4 | 2 | 2 | 部署架构没有识别 Ubuntu 镜像 root SSH 风险。 |
| FE-04 筛选与日历 | 3 | 1 | 2 | 成员筛选存在字符串和 UUID/ID 类型不一致风险。 |
| FE-06 动画与交互反馈 | 2 | 1 | 1 | 响应式/动画细节有偏差,交互验收不完整。 |
| FE-08 响应式适配 | 1 | 0 | 1 | 长标题可能溢出,响应式/文本保护不足。 |
| BE-05 字段约束落地 | 2 | 1 | 1 | 描述长度和前端筛选类型问题说明字段约束落地不充分。 |
| BE-06 初始化与种子数据 | 2 | 1 | 1 | 部署资源混乱和重启问题影响种子数据/服务恢复验收。 |
| TS-02 E2E 覆盖和通过率 | 4 | 2 | 2 | 未见充分当前复跑证据,部署重启问题未覆盖。 |
| TS-03 readonly/权限 E2E | 3 | 2 | 1 | 权限相关 E2E 覆盖证据不足。 |
| TS-06 风险点单测 | 3 | 2 | 1 | 测试未覆盖 Docker 自启动、防火墙、SSH 等部署风险。 |
| PD-01 问题识别 | 8 | 1 | 7 | SSH 登录阻塞、创建资源失败、防火墙未配置均需人工介入。 |
| PD-02 修复闭环 | 8 | 5 | 3 | SSH、防火墙、资源选择问题未能独立闭环。 |
| CR-01 代码结构与可维护性 | 8 | 3 | 5 | 部署状态分散在多套资源文件,资源治理混乱。 |
| CR-02 安全与错误处理 | 7 | 2 | 5 | 创建资源失败后未提示用户就改用其他服务器,有安全和评测污染风险。 |
| DP-01 UCloud CLI 创建资源 | 2 | 1 | 1 | 创建资源失败,后续改用其它服务器部署。 |
| DP-03 SSH 登录和服务器连接 | 3 | 0 | 3 | SSH 登录阻塞,需要用户确认修复方案后继续。 |
| DP-04 防火墙和公网端口 | 4 | 0 | 4 | 默认未配置 UCloud 防火墙,导致公网访问不了。 |
| DP-05 Docker Compose 部署 | 3 | 2 | 1 | Docker 部署可推进,但服务器关机开机后 Docker 未自启动。 |
| DP-06 公网功能验收 | 3 | 2 | 1 | 防火墙缺失和资源混乱影响公网验收完整性。 |
| DP-07 重启恢复能力 | 2 | 0 | 2 | 服务器关机开机后 Docker 没有自启动。 |
| DP-08 调试和清理说明 | 1 | 0 | 1 | 创建资源失败后改用其它服务器且资源记录混乱,调试和清理说明不足以避免资源残留或误删。 |
模型 人工验收问题数 计入的问题 GLM 5.2 2 长文本标题溢出容器;首页只有登录按钮,缺少注册入口 Claude Opus 4.8 1 长标题溢出容器 ChatGPT 5.5 2 部署断点重启需要人工介入;长标题溢出容器 GLM 5.1 3 前端样式丢失;刷新页面登录信息未保存;首次进入项目页任务数据不加载 Qwen3.7 Max 3 ER 图解析失败;状态流转接口 405;缺少用户邀请功能 Deepseek V4 Pro 5 assignee_id 类型错误导致 422;/api/login 404;重新打开任务目标状态错误;缺少成员管理组件;部署断点重启需要人工介入 Kimi K2.6 4 SSH 登录阻塞;创建资源失败后未提示用户就使用其它服务器;默认未配置 UCloud 防火墙;服务器关机开机后 Docker 未自启动
E.2 人工验收问题逐项明细
模型 序号 问题 类型 GLM 5.2 1 页面标题太长时溢出容器 前端显示 GLM 5.2 2 首页页面只有登录按钮,无法直接切换到注册页面;实际 /register 页面存在且可正常注册 前端入口/导航 Claude Opus 4.8 1 页面标题太长时溢出容器 前端显示 ChatGPT 5.5 1 部署过程需要人工介入处理断点重启 部署 ChatGPT 5.5 2 页面标题太长时溢出容器 前端显示 GLM 5.1 1 前端样式丢失 前端显示 GLM 5.1 2 刷新页面后登录信息没有保存 前端状态 GLM 5.1 3 首次进入项目页面时任务数据不会加载 前端数据加载 Qwen3.7 Max 1 需求/设计文档中的 Mermaid ER 图解析失败 需求/设计文档 Qwen3.7 Max 2 修改任务状态时报 POST /api/tasks/1/transition 405 Method Not Allowed 核心功能/API Qwen3.7 Max 3 前端页面缺少用户邀请功能,无法邀请其他用户加入项目 前端功能 Deepseek V4 Pro 1 修改任务时 assignee_id 提交字符串,后端返回 422 前后端字段约定 Deepseek V4 Pro 2 登录请求 /api/login 返回 404 Not Found 登录/API Deepseek V4 Pro 3 “重新打开”任务时目标状态不对,后端拒绝 done -> todo 状态机 Deepseek V4 Pro 4 前端缺少成员管理组件 前端功能 Deepseek V4 Pro 5 部署过程需要人工介入处理断点重启 部署 Kimi K2.6 1 SSH 登录阻塞,需要用户确认修复方案后继续部署 部署/连接 Kimi K2.6 2 创建资源失败后未提示用户就使用其它服务器部署 部署/资源治理 Kimi K2.6 3 默认未配置 UCloud 防火墙,导致公网访问不了 部署/网络 Kimi K2.6 4 服务器关机开机后 Docker 没有自启动 部署/重启恢复
E.3 开发自修 Bug 数 开发自修 Bug 数只统计模型在正式 FT session 中自己遇到失败、报错、测试不通过或部署异常后,自己定位、修改并复测的闭环事件。同一根因的多次重试只算 1 个;人工验收发现的问题不计入这里。
模型 开发自修 Bug 数 计入口径和主要依据 GLM 5.2 14 前端 import/TypeScript;PostgreSQL 旧 volume;鉴权 500;单测 token 假设;pytest marker;E2E 导入/rootdir/跳转;SSH 用户和密码;Docker 安装;Docker Hub/PyPI/apt 网络;UCloud 防火墙公网访问问题 Claude Opus 4.8 10 DB healthcheck/stale volume;pytest-playwright fixture 冲突;Chrome 启动兼容;E2E 状态切换等待;E2E toast 干扰;邀请成员刷新等待;删除后计数等待;SSH 默认用户识别;Docker 安装脚本/远端命令问题;Docker Hub 镜像和 UCloud 防火墙访问问题 ChatGPT 5.5 8 前端 JSX 构建失败;本地端口冲突;后端健康检查失败/旧 volume;E2E fixture 冲突;Playwright URL 断言写法;请求封装 Content-Type 导致 422;SSH/expect 登录脚本问题;rsync/scp 与 Docker Hub 镜像超时问题 GLM 5.1 8 API {success,data} 解包和导入问题;模态框枚举值/API 使用问题;nginx.conf Docker 构建路径;后端 HTTPException 导入;数据库启动顺序/健康检查;“重新打开”目标状态错误;SSH 登录用户/密码问题;公网 80/3000 访问和防火墙问题 Qwen3.7 Max 7 Docker Compose/healthcheck 校验;本地 5432 端口冲突;数据库认证/旧 volume;psycopg2.pool 缺失;FastAPI trailing slash 307;SSH 密码和 known_hosts 问题;Docker 安装、rsync/nginx 部署问题。用户人工指出的状态流转 405 不计入开发自修 Bug Deepseek V4 Pro 18 后端重复模块/导入和响应封装冲突;本地 DB 端口冲突;dotenv/test DB 配置;Starlette/httpx 依赖冲突;测试用户隔离;sample_tasks 状态准备错误;本地后端端口冲突;SSH 认证;安全组权限;Docker 安装/apt 源;tar 打包语法;requirements/pip/npm 镜像;远端 .env 重复值;旧 Dockerfile/旧代码未覆盖;nginx.conf 构建上下文;npm ci 缺 package-lock;后端 main.py 导入路径;UCloud 防火墙公网访问。用户人工指出的 422、404、重新打开状态错误不计入开发自修 Bug Kimi K2.6 12 UHostId JSON 数组提取;known_hosts 旧 key;SSH/root/password/keypair 登录阻塞;FastAPI Depends 异步依赖写法;前端 import 路径;后端模块路径/PYTHONPATH;rsync 权限;Docker Compose 构建超时/SSH 不稳定;Docker 安装脚本失败改用 snap;snap Docker 工作目录限制;Docker Hub 拉取超时;后端 Dockerfile apt/pip 镜像和上传重试。用户人工指出的刷新登录态、首次项目任务不加载不计入开发自修 Bug
E.4 开发自修 Bug 逐项明细
| 模型 | 序号 | 自修 Bug / 异常 | 归类 |
|---|---|---|---|
| GLM 5.2 | 1 | 前端 import 路径错误导致构建失败,修正 auth 页面 import | 前端构建 |
| GLM 5.2 | 2 | import.meta.env / Vite 类型问题,补充类型声明 | 前端构建 |
| GLM 5.2 | 3 | PostgreSQL 旧 volume 导致密码认证失败,清理并改唯一 volume 名称 | 数据库/Docker |
| GLM 5.2 | 4 | /api/users 无 token 返回 500,重构 auth dependency 后返回 401 | 后端鉴权 |
| GLM 5.2 | 5 | 单测中 register 后错误读取 token,改为注册后登录获取 token | 测试 |
| GLM 5.2 | 6 | pytest marker 配置缺失或不稳,补充 pytest 配置 | 测试配置 |
| GLM 5.2 | 7 | E2E 相对导入失败,调整导入方式 | E2E |
| GLM 5.2 | 8 | E2E rootdir/timeout 参数问题,调整运行方式 | E2E |
| GLM 5.2 | 9 | 注册后未自动跳转首页导致 E2E 失败,修正登录/注册路由跳转 | 前端路由 |
| GLM 5.2 | 10 | UCloud SSH 密码登录失败,停止/重置/启动并切换 ubuntu 用户完成连接 | 部署/SSH |
| GLM 5.2 | 11 | 远端服务器无 Docker,安装 Docker Engine 和 Compose plugin | 部署/Docker |
| GLM 5.2 | 12 | Docker Hub 拉取超时,配置镜像加速和后台构建 | 部署/网络 |
| GLM 5.2 | 13 | Debian apt 源下载极慢,优化 Dockerfile 去掉 apt 编译依赖 | 部署/构建 |
| GLM 5.2 | 14 | PyPI 访问失败,改用国内 pip 源;公网 80/3000 超时后配置 UCloud 防火墙 | 部署/网络 |
| Claude Opus 4.8 | 1 | 数据库 healthcheck 或旧 volume 导致服务状态异常,清理后复测 | 后端/数据库 |
| Claude Opus 4.8 | 2 | pytest-playwright fixture 冲突,调整测试配置后复测 | 测试 |
| Claude Opus 4.8 | 3 | Chrome/Playwright 启动兼容问题,调整启动方式后复测 | 测试 |
| Claude Opus 4.8 | 4 | E2E 状态切换等待不稳定,补充等待逻辑后复测 | 测试 |
| Claude Opus 4.8 | 5 | E2E toast 干扰点击或断言,调整选择器/等待后复测 | 测试 |
| Claude Opus 4.8 | 6 | 邀请成员后刷新等待不稳定,调整流程后复测 | 前端/E2E |
| Claude Opus 4.8 | 7 | 删除任务后计数等待不稳定,调整断言后复测 | 前端/E2E |
| Claude Opus 4.8 | 8 | SSH 默认用户识别错误,切换正确用户后继续部署 | 部署/SSH |
| Claude Opus 4.8 | 9 | Docker 安装脚本或远端命令问题,修正后继续部署 | 部署/Docker |
| Claude Opus 4.8 | 10 | Docker Hub 镜像拉取和 UCloud 防火墙访问问题,处理后完成公网验收 | 部署/网络 |
| ChatGPT 5.5 | 1 | 前端 JSX 构建失败,修正代码后重新构建 | 前端构建 |
| ChatGPT 5.5 | 2 | 本地端口冲突,调整进程/端口后继续测试 | 本地环境 |
| ChatGPT 5.5 | 3 | 后端健康检查失败或旧 volume 影响启动,清理后复测 | 后端/数据库 |
| ChatGPT 5.5 | 4 | E2E fixture 冲突,调整测试配置后复跑 | 测试 |
| ChatGPT 5.5 | 5 | Playwright URL 断言写法不稳定,修正断言后复跑 | 测试 |
| ChatGPT 5.5 | 6 | 请求封装 Content-Type 导致 422,修正请求逻辑后复测 | 前后端接口 |
| ChatGPT 5.5 | 7 | SSH/expect 登录脚本问题,调整脚本后继续部署 | 部署/SSH |
| ChatGPT 5.5 | 8 | rsync/scp 与 Docker Hub 镜像超时,调整上传/拉取方式后继续部署 | 部署/网络 |
| GLM 5.1 | 1 | API {success,data} 解包和导入问题,修正后复测 | 前后端接口 |
| GLM 5.1 | 2 | 模态框枚举值或 API 使用问题,修正后复测 | 前端/API |
| GLM 5.1 | 3 | nginx.conf Docker 构建路径错误,调整构建上下文后复测 | 部署/前端 |
| GLM 5.1 | 4 | 后端 HTTPException 导入缺失,补充导入后复测 | 后端 |
| GLM 5.1 | 5 | 数据库启动顺序或健康检查问题,调整依赖后复测 | 后端/数据库 |
| GLM 5.1 | 6 | "重新打开"任务目标状态错误,调整状态转换后复测 | 状态机 |
| GLM 5.1 | 7 | SSH 登录用户或密码问题,调整登录方式后继续部署 | 部署/SSH |
| GLM 5.1 | 8 | 公网 80/3000 访问和防火墙问题,调整网络配置后复测 | 部署/网络 |
| Qwen3.7 Max | 1 | Docker Compose healthcheck 校验问题,调整配置后复测 | 部署/Docker |
| Qwen3.7 Max | 2 | 本地 5432 端口冲突,调整本地数据库/端口后继续测试 | 本地环境 |
| Qwen3.7 Max | 3 | 数据库认证或旧 volume 问题,清理/修正后复测 | 后端/数据库 |
| Qwen3.7 Max | 4 | psycopg2.pool 缺失,补充依赖或调整实现后复测 | 后端依赖 |
| Qwen3.7 Max | 5 | FastAPI trailing slash 307 问题,调整路由或请求后复测 | 后端/API |
| Qwen3.7 Max | 6 | SSH 密码和 known_hosts 问题,处理后继续部署 | 部署/SSH |
| Qwen3.7 Max | 7 | Docker 安装、rsync/nginx 部署问题,调整后继续公网部署 | 部署 |
| Deepseek V4 Pro | 1 | 后端重复模块、导入和响应封装冲突,整理后复测 | 后端结构 |
| Deepseek V4 Pro | 2 | 本地数据库端口冲突,调整后继续测试 | 本地环境 |
| Deepseek V4 Pro | 3 | dotenv/test DB 配置问题,修正测试环境后复测 | 测试/配置 |
| Deepseek V4 Pro | 4 | Starlette/httpx 依赖冲突,调整依赖后复测 | 后端依赖 |
| Deepseek V4 Pro | 5 | 测试用户隔离问题,调整测试数据后复测 | 测试 |
| Deepseek V4 Pro | 6 | sample_tasks 状态准备错误,修正 fixture 后复测 | 测试/状态机 |
| Deepseek V4 Pro | 7 | 本地后端端口冲突,调整进程/端口后继续测试 | 本地环境 |
| Deepseek V4 Pro | 8 | SSH 认证问题,调整连接方式后继续部署 | 部署/SSH |
| Deepseek V4 Pro | 9 | 安全组权限问题,调整 UCloud 网络规则后复测 | 部署/网络 |
| Deepseek V4 Pro | 10 | Docker 安装或 apt 源问题,调整安装方式后继续部署 | 部署/Docker |
| Deepseek V4 Pro | 11 | tar 打包语法问题,修正打包命令后继续上传 | 部署/打包 |
| Deepseek V4 Pro | 12 | requirements/pip/npm 镜像问题,调整镜像源后继续构建 | 构建/依赖 |
| Deepseek V4 Pro | 13 | 远端 .env 重复值问题,清理配置后复测 | 部署/配置 |
| Deepseek V4 Pro | 14 | 旧 Dockerfile 或旧代码未覆盖,重新同步后复测 | 部署/构建 |
| Deepseek V4 Pro | 15 | nginx.conf 构建上下文问题,调整 Docker 构建后复测 | 前端部署 |
| Deepseek V4 Pro | 16 | npm ci 缺少 package-lock,调整安装命令后继续构建 | 前端构建 |
| Deepseek V4 Pro | 17 | 后端 main.py 导入路径问题,修正后复测 | 后端启动 |
| Deepseek V4 Pro | 18 | UCloud 防火墙公网访问问题,调整规则后复测 | 部署/网络 |
| Kimi K2.6 | 1 | UHostId JSON 数组提取错误,修正解析后继续创建/查询资源 | UCloud CLI |
| Kimi K2.6 | 2 | known_hosts 旧 key 冲突,清理后继续 SSH | 部署/SSH |
| Kimi K2.6 | 3 | SSH/root/password/keypair 登录阻塞,多次调整登录方式后继续 | 部署/SSH |
| Kimi K2.6 | 4 | FastAPI Depends 异步依赖写法问题,修正后复测 | 后端 |
| Kimi K2.6 | 5 | 前端 import 路径错误,修正后重新构建 | 前端构建 |
| Kimi K2.6 | 6 | 后端模块路径或 PYTHONPATH 问题,调整后复测 | 后端启动 |
| Kimi K2.6 | 7 | rsync 权限问题,调整上传方式后继续部署 | 部署/上传 |
| Kimi K2.6 | 8 | Docker Compose 构建超时或 SSH 不稳定,调整后继续部署 | 部署/Docker |
| Kimi K2.6 | 9 | Docker 安装脚本失败后改用 snap Docker | 部署/Docker |
| Kimi K2.6 | 10 | snap Docker 工作目录限制,调整目录/权限后继续 | 部署/Docker |
| Kimi K2.6 | 11 | Docker Hub 拉取超时,调整镜像拉取/重试后继续 | 部署/网络 |
| Kimi K2.6 | 12 | 后端 Dockerfile apt/pip 镜像和上传重试问题,调整后继续部署 | 部署/构建 |