Files
wecom_it_smart_desk/docs/01-产品文档/03-AI服务/PRD-REQ-AI-003-多模态视觉理解-v1.0.md
T
Simon 44e77dcb0e chore(docs): docs/ 目录全面重新编号 + 重组
**重构前**(旧编号 02-11):
- docs/02-产品需求/      → 00 产品规划/PRD
- docs/03-技术架构/      → 01-05 子目录散落
- docs/04-原型设计/      → 01-02 产品设计(HTML 原型)
- docs/05-原型设计/      → screens/
- docs/06-测试素材/      → 02-E2E / 03-功能 / 04-版本测试
- docs/07-项目管理/      → 任务说明书/日报/计划
- docs/08-安全审计/      → 审计报告
- docs/09-堡垒运维/      → toolbox / deploy
- docs/10-项目管理/      → 任务说明书(重复)
- docs/11-历史归档/      → deploy-nas-archived

**重构后**(新编号 00-07,语义化):
- docs/00-产品开发流程与文档管理规范.md
- docs/00-版本迭代总览.md
- docs/01-产品文档/      (PRD/原型/认证/会话/AI 服务/坐席/集成)
- docs/02-技术文档/      (技术方案/架构图/重构记录/前端改造/实现配置)
- docs/03-测试文档/      (E2E/功能用例/版本报告/缺陷单)
- docs/04-运维文档/      (部署运维/运维指南)
- docs/05-运营文档/      (品牌推广/用户手册)
- docs/06-安全审计/      (审计报告)
- docs/07-项目管理/      (任务说明书/日报/计划/看板)

**净收益**:
- 目录编号与产品文档管理规范对齐(按文档阶段 01-07 编号)
- 消除 02-产品需求 与 10-项目管理 的编号重叠
- 子目录按文档类型分组(如 01-产品文档/00-产品规划、01-产品文档/01-认证与登录)
- 把运维/安全/项目管理从 0X 散落改为 04/06/07

合计 494 文件 + 78495 行 / - 14076 行
2026-08-03 18:46:55 +08:00

120 lines
2.9 KiB
Markdown
Raw Blame History

This file contains ambiguous Unicode characters
This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.
# PRD - 多模态视觉理解
> **REQ编号**: REQ-AI-003
> **版本**: v1.0
> **优先级**: P2
> **阶段**: 中期(3-4个月)
> **作者**: 宋献
> **日期**: 2026-07-19
---
## 一、问题陈述
**用户问题**
- 员工遇到错误弹窗、蓝屏、代码报错等问题时,只能文字描述
- 文字描述往往不准确,AI 难以理解真实问题
- 导致问题解决效率低
**业务目标**
- 员工上传截图后,AI 自动识别图片内容
- AI 根据图片给出诊断建议或解决方案
- 提升问题一次解决率
---
## 二、需求范围
### 2.1 核心功能
| 功能 | 描述 |
|------|------|
| 图片理解 | 上传截图后,AI 自动识别图片内容 |
| 错误识别 | 自动识别错误码、蓝屏、弹窗、日志等 |
| 诊断建议 | 根据图片内容给出诊断建议 |
| 多图支持 | 支持一次上传多张图片 |
### 2.2 非目标
- 不支持视频理解
- 不支持语音理解(后续迭代)
- 不支持图片编辑/标注
---
## 三、用户故事
| 角色 | 用户故事 | 验收标准 |
|------|----------|---------|
| 员工 | 我可以上传问题截图获取帮助 | 上传截图后,AI 自动分析并给出建议 |
| 员工 | 我可以一次上传多张图片 | 最多支持 4 张图片同时上传分析 |
| 坐席 | 我可以看到用户上传的图片 | 图片作为消息展示,点击可放大 |
---
## 四、功能详情
### 4.1 交互流程
```
员工上传图片 → AI视觉模型分析 → 识别问题类型 → 生成诊断建议 → 返回给用户
```
### 4.2 支持的图片类型
| 类型 | 示例 |
|------|------|
| 错误弹窗 | "连接失败"、"权限不足" |
| 蓝屏/黑屏 | Windows BSOD、系统崩溃 |
| 代码报错 | 编译器错误、运行时异常 |
| 日志截图 | 应用日志、服务器日志 |
| UI异常 | 界面显示异常、布局错乱 |
### 4.3 返回格式
```json
{
"image_description": "Windows 10 蓝屏,错误代码 DRIVER_IRQL_NOT_LESS_OR_EQUAL",
"problem_type": "系统崩溃",
"diagnosis": "可能是驱动程序不兼容导致",
"suggestions": [
"尝试重启计算机",
"检查最近安装的驱动程序",
"使用系统还原恢复"
],
"confidence": 0.85
}
```
### 4.4 技术方案
- 调用视觉大模型 API(如 GPT-4V、Claude Vision
- 图片先压缩再发送,控制成本
- 支持主流图片格式:JPG、PNG、GIF、BMP
---
## 五、指标设计
| 指标 | 目标 | 测量方式 |
|------|------|---------|
| 图片理解准确率 | ≥ 75% | 识别结果被标记正确的比例 |
| 平均响应时间 | ≤ 5s | 上传图片到返回结果的时间 |
| 用户满意度 | ≥ 4.0 | 用户对AI理解结果的评价 |
---
## 六、技术依赖
| 依赖项 | 说明 |
|--------|------|
| 视觉大模型 API | 图片理解能力 |
| 文件上传服务 | REQ-用户-002 |
---
## 七、关联文档
- 前置需求: REQ-用户-002 文件上传
- 后续需求: 无