在 Trae 、Qoder 下,分别用 Deepseek-v4 和 Kimi-K3 跑编程任务。Kimi-K3 挺让人失望的
AI Coding 测评准备
测试项目:桌面端知识库工具
用户导入本地文档,系统建立分块索引,支持自然语言提问并返回带引用来源的回答
初始脚手架
运行时:Electron 33 (主进程 Node.js+Chromium )
前端:React 18 + TypeScript ( Vite 构建)
后端:TypeScript 服务层
大家如果想要自己完整测评一下,可以评论区留言,把原项目开源出来
Vibe Coding 工具和大模型
编程工具分别用 字节 Trae 、阿里 Qoder
大模型选择 deepseek-v4-pro、kimi-3
https://platform.deepseek.com/
platform.kimi.com
知识库工具项目代码,项目名叫starter
用 Harness 加持原starter项目下,新项目叫solution_log
为什么要用到 Harness 的原理,可以阅读下我的文章
https://mp.weixin.qq.com/s/-9Jfwv2SqswbvwZJx5D5bQ
开始测评
将 知识库 和 Harness + 知识库 两个项目通过 Vibe Coding 完成同样功能开发,相同的需求提示词是这样的
# 任务:构建知识库问答工具
## 产品描述
开发一个桌面端个人知识库问答工具。用户可以导入本地文档,系统对文档建立索引,然后用户可以用自然语言提问,系统从文档中检索相关内容并给出有依据的回答。
## 核心功能需求
### 1. 文档导入
- 用户点击"导入文档"按钮,选择本地 `.txt` 或 `.md` 文件
- 导入后文档显示在左侧文档列表中,包含文件名、大小、导入状态
- 文件大小限制 10MB
### 2. 文档索引
- 导入后,用户点击"建立索引"将文档分块存储
- 索引按段落切分,每块约 500 字
- 索引完成后文档状态变为"已索引",显示分块数量
### 3. 问答功能
- 底部输入框输入问题,点击"提问"按钮
- 系统用关键词匹配方式在已索引分块中检索相关内容
- 返回回答文本 + 引用来源(文档名、分块位置、摘录内容)
- 显示置信度(有引用:0.8 ,无引用:0.2 )
- 每次问答自动保存到历史记录
### 4. 历史记录
- 点击"历史记录"按钮查看所有历史问答
- 以对话气泡形式展示(用户问题在右,系统回答在左)
- 显示时间戳和置信度
## 验收标准
1. 可以导入 `.txt` 或 `.md` 文件,文档出现在列表中
2. 点击"建立索引"后文档状态变为"已索引"
3. 提问后能返回含引用的回答
4. 历史记录中能看到所有问答
5. 重启应用后数据依然存在
在原来的客户端上,一口气开发 "文档导入"、"文档索引"、"问答功能"、"历史记录"四个新功能,并希望 AI 自动化测试验收
测评的结果
| 项目 | Coding 环境 | 费用时间 | 成功 |
|---|---|---|---|
| 知识库 | Qoder + Deepseek-V4 | 4 分钟 1RMB | 是 |
| 知识库 | Qoder + Kimi-K3 | 15 分钟 8RMB | 否 |
| 知识库 | Trae + Deepseek-V4 | 5 分钟 1RMB | 是 |
| 知识库 | Trae + Kimi-K3 | 15 分钟 9RMB | 否 |
| 知识库+harness | Trae + Deepseek-V4 | 2 分钟 0.5RMB | 是 |
| 知识库+harness | Trae + Kimi-K3 | 18 分钟 8RMB | 是 |
| 知识库+harness | Qoder + Deepseek-V4 | 2 分钟 0.6RMB | 是 |
| 知识库+harness | Qoder + Kimi-K3 | 12 分钟 9RMB | 是 |
Kimi-K3 总结
- 价格比较贵,对比 deepseek-v4-pro ,可能是 Kimi-K3 定价较贵缘故,同样的结果 Token 开销查了近 10 倍左右
- 在 Qoder 、Trae 集成上编程能力整体表现不如 deepseek-v4-pro ,而且执行时间远远增加
完整案例实操视频和完整原文 https://mp.weixin.qq.com/s/k92i1_ORy5mDE1bOdRG-kw