Files
wecom_it_smart_desk/docs/01-产品文档/03-AI服务/PRD-REQ-AI-003-多模态视觉理解-v1.0.md
T
Simon 44e77dcb0e chore(docs): docs/ 目录全面重新编号 + 重组
**重构前**(旧编号 02-11):
- docs/02-产品需求/      → 00 产品规划/PRD
- docs/03-技术架构/      → 01-05 子目录散落
- docs/04-原型设计/      → 01-02 产品设计(HTML 原型)
- docs/05-原型设计/      → screens/
- docs/06-测试素材/      → 02-E2E / 03-功能 / 04-版本测试
- docs/07-项目管理/      → 任务说明书/日报/计划
- docs/08-安全审计/      → 审计报告
- docs/09-堡垒运维/      → toolbox / deploy
- docs/10-项目管理/      → 任务说明书(重复)
- docs/11-历史归档/      → deploy-nas-archived

**重构后**(新编号 00-07,语义化):
- docs/00-产品开发流程与文档管理规范.md
- docs/00-版本迭代总览.md
- docs/01-产品文档/      (PRD/原型/认证/会话/AI 服务/坐席/集成)
- docs/02-技术文档/      (技术方案/架构图/重构记录/前端改造/实现配置)
- docs/03-测试文档/      (E2E/功能用例/版本报告/缺陷单)
- docs/04-运维文档/      (部署运维/运维指南)
- docs/05-运营文档/      (品牌推广/用户手册)
- docs/06-安全审计/      (审计报告)
- docs/07-项目管理/      (任务说明书/日报/计划/看板)

**净收益**:
- 目录编号与产品文档管理规范对齐(按文档阶段 01-07 编号)
- 消除 02-产品需求 与 10-项目管理 的编号重叠
- 子目录按文档类型分组(如 01-产品文档/00-产品规划、01-产品文档/01-认证与登录)
- 把运维/安全/项目管理从 0X 散落改为 04/06/07

合计 494 文件 + 78495 行 / - 14076 行
2026-08-03 18:46:55 +08:00

2.9 KiB
Raw Blame History

PRD - 多模态视觉理解

REQ编号: REQ-AI-003 版本: v1.0 优先级: P2 阶段: 中期(3-4个月) 作者: 宋献 日期: 2026-07-19


一、问题陈述

用户问题

  • 员工遇到错误弹窗、蓝屏、代码报错等问题时,只能文字描述
  • 文字描述往往不准确,AI 难以理解真实问题
  • 导致问题解决效率低

业务目标

  • 员工上传截图后,AI 自动识别图片内容
  • AI 根据图片给出诊断建议或解决方案
  • 提升问题一次解决率

二、需求范围

2.1 核心功能

功能 描述
图片理解 上传截图后,AI 自动识别图片内容
错误识别 自动识别错误码、蓝屏、弹窗、日志等
诊断建议 根据图片内容给出诊断建议
多图支持 支持一次上传多张图片

2.2 非目标

  • 不支持视频理解
  • 不支持语音理解(后续迭代)
  • 不支持图片编辑/标注

三、用户故事

角色 用户故事 验收标准
员工 我可以上传问题截图获取帮助 上传截图后,AI 自动分析并给出建议
员工 我可以一次上传多张图片 最多支持 4 张图片同时上传分析
坐席 我可以看到用户上传的图片 图片作为消息展示,点击可放大

四、功能详情

4.1 交互流程

员工上传图片 → AI视觉模型分析 → 识别问题类型 → 生成诊断建议 → 返回给用户

4.2 支持的图片类型

类型 示例
错误弹窗 "连接失败"、"权限不足"
蓝屏/黑屏 Windows BSOD、系统崩溃
代码报错 编译器错误、运行时异常
日志截图 应用日志、服务器日志
UI异常 界面显示异常、布局错乱

4.3 返回格式

{
  "image_description": "Windows 10 蓝屏,错误代码 DRIVER_IRQL_NOT_LESS_OR_EQUAL",
  "problem_type": "系统崩溃",
  "diagnosis": "可能是驱动程序不兼容导致",
  "suggestions": [
    "尝试重启计算机",
    "检查最近安装的驱动程序",
    "使用系统还原恢复"
  ],
  "confidence": 0.85
}

4.4 技术方案

  • 调用视觉大模型 API(如 GPT-4V、Claude Vision
  • 图片先压缩再发送,控制成本
  • 支持主流图片格式:JPG、PNG、GIF、BMP

五、指标设计

指标 目标 测量方式
图片理解准确率 ≥ 75% 识别结果被标记正确的比例
平均响应时间 ≤ 5s 上传图片到返回结果的时间
用户满意度 ≥ 4.0 用户对AI理解结果的评价

六、技术依赖

依赖项 说明
视觉大模型 API 图片理解能力
文件上传服务 REQ-用户-002

七、关联文档

  • 前置需求: REQ-用户-002 文件上传
  • 后续需求: 无