Files
wecom_it_smart_desk/docs/01-产品文档/03-AI服务/PRD-REQ-AI-003-多模态视觉理解-v1.0.md
Simon facc04aa65 chore: docs 结构整改 + compose 双目录对齐(合并重建提交)
本提交为 .git 对象库损坏后的重建提交,内容等价于原先三个本地提交
(5e2fd4c2 / 57a53c98 / 5d7e1873)的累积结果,未做任何额外改动。

一、docs 结构整改(整改 #14)
根因:重构时新结构为 untracked 文件,执行 git stash(未带 -u)未纳入,
随后 git reset 拉回 HEAD 旧 tracked 树,导致旧树复活、新旧两棵目录
树并存于 docs/,共 791 文件、双分类体系冲突。

修复动作:
- b2 同名异主题文件改名迁移保全 9 个
- C 类 39 个孤立文件按主题正确归类
- A/B1 类 222 个重复文件删除(新结构已有内容副本)
- 9 个旧独有空目录删除
- 270 处内部引用按 verified 映射改写
- 整改记录 #14 登记于 04-运维文档/部署运维

结果:docs 791 → 569 文件,顶层仅规范 8 类 + 治理文件,单树恢复。
残留:约 20 处指向从未存在文件的陈旧死链,归入独立文档卫生任务。

二、compose 双目录对齐(消除踩坑 A)
- docker-compose.yml:nginx 前端挂载全部由根目录 frontend-*/dist
  改为 src/frontend-*/dist(h5 / agent / admin / terminal)
- docker-compose.dev.yml:dev 服务 build context 与卷同步改 src/
- 效果:本地 docker compose up 不再把根目录 stale dist 挂回,
  与线上一致,分叉隐患消除(已 docker compose config 校验通过)

防复发铁律:
- 重构须提交;仓库修复须 git stash -u 或先 commit
- 新结构须 git add 并提交,避免再次 untracked 复活
- H5 改动只动 src/frontend-h5/,禁改根目录遗留 frontend-*/
2026-08-07 22:31:32 +08:00

120 lines
2.9 KiB
Markdown
Raw Permalink Blame History

This file contains ambiguous Unicode characters
This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.
# PRD - 多模态视觉理解
> **REQ编号**: REQ-AI-003
> **版本**: v1.0
> **优先级**: P2
> **阶段**: 中期(3-4个月)
> **作者**: 宋献
> **日期**: 2026-07-19
---
## 一、问题陈述
**用户问题**
- 员工遇到错误弹窗、蓝屏、代码报错等问题时,只能文字描述
- 文字描述往往不准确,AI 难以理解真实问题
- 导致问题解决效率低
**业务目标**
- 员工上传截图后,AI 自动识别图片内容
- AI 根据图片给出诊断建议或解决方案
- 提升问题一次解决率
---
## 二、需求范围
### 2.1 核心功能
| 功能 | 描述 |
|------|------|
| 图片理解 | 上传截图后,AI 自动识别图片内容 |
| 错误识别 | 自动识别错误码、蓝屏、弹窗、日志等 |
| 诊断建议 | 根据图片内容给出诊断建议 |
| 多图支持 | 支持一次上传多张图片 |
### 2.2 非目标
- 不支持视频理解
- 不支持语音理解(后续迭代)
- 不支持图片编辑/标注
---
## 三、用户故事
| 角色 | 用户故事 | 验收标准 |
|------|----------|---------|
| 员工 | 我可以上传问题截图获取帮助 | 上传截图后,AI 自动分析并给出建议 |
| 员工 | 我可以一次上传多张图片 | 最多支持 4 张图片同时上传分析 |
| 坐席 | 我可以看到用户上传的图片 | 图片作为消息展示,点击可放大 |
---
## 四、功能详情
### 4.1 交互流程
```
员工上传图片 → AI视觉模型分析 → 识别问题类型 → 生成诊断建议 → 返回给用户
```
### 4.2 支持的图片类型
| 类型 | 示例 |
|------|------|
| 错误弹窗 | "连接失败"、"权限不足" |
| 蓝屏/黑屏 | Windows BSOD、系统崩溃 |
| 代码报错 | 编译器错误、运行时异常 |
| 日志截图 | 应用日志、服务器日志 |
| UI异常 | 界面显示异常、布局错乱 |
### 4.3 返回格式
```json
{
"image_description": "Windows 10 蓝屏,错误代码 DRIVER_IRQL_NOT_LESS_OR_EQUAL",
"problem_type": "系统崩溃",
"diagnosis": "可能是驱动程序不兼容导致",
"suggestions": [
"尝试重启计算机",
"检查最近安装的驱动程序",
"使用系统还原恢复"
],
"confidence": 0.85
}
```
### 4.4 技术方案
- 调用视觉大模型 API(如 GPT-4V、Claude Vision
- 图片先压缩再发送,控制成本
- 支持主流图片格式:JPG、PNG、GIF、BMP
---
## 五、指标设计
| 指标 | 目标 | 测量方式 |
|------|------|---------|
| 图片理解准确率 | ≥ 75% | 识别结果被标记正确的比例 |
| 平均响应时间 | ≤ 5s | 上传图片到返回结果的时间 |
| 用户满意度 | ≥ 4.0 | 用户对AI理解结果的评价 |
---
## 六、技术依赖
| 依赖项 | 说明 |
|--------|------|
| 视觉大模型 API | 图片理解能力 |
| 文件上传服务 | REQ-用户-002 |
---
## 七、关联文档
- 前置需求: REQ-用户-002 文件上传
- 后续需求: 无