44e77dcb0e
**重构前**(旧编号 02-11): - docs/02-产品需求/ → 00 产品规划/PRD - docs/03-技术架构/ → 01-05 子目录散落 - docs/04-原型设计/ → 01-02 产品设计(HTML 原型) - docs/05-原型设计/ → screens/ - docs/06-测试素材/ → 02-E2E / 03-功能 / 04-版本测试 - docs/07-项目管理/ → 任务说明书/日报/计划 - docs/08-安全审计/ → 审计报告 - docs/09-堡垒运维/ → toolbox / deploy - docs/10-项目管理/ → 任务说明书(重复) - docs/11-历史归档/ → deploy-nas-archived **重构后**(新编号 00-07,语义化): - docs/00-产品开发流程与文档管理规范.md - docs/00-版本迭代总览.md - docs/01-产品文档/ (PRD/原型/认证/会话/AI 服务/坐席/集成) - docs/02-技术文档/ (技术方案/架构图/重构记录/前端改造/实现配置) - docs/03-测试文档/ (E2E/功能用例/版本报告/缺陷单) - docs/04-运维文档/ (部署运维/运维指南) - docs/05-运营文档/ (品牌推广/用户手册) - docs/06-安全审计/ (审计报告) - docs/07-项目管理/ (任务说明书/日报/计划/看板) **净收益**: - 目录编号与产品文档管理规范对齐(按文档阶段 01-07 编号) - 消除 02-产品需求 与 10-项目管理 的编号重叠 - 子目录按文档类型分组(如 01-产品文档/00-产品规划、01-产品文档/01-认证与登录) - 把运维/安全/项目管理从 0X 散落改为 04/06/07 合计 494 文件 + 78495 行 / - 14076 行
2.9 KiB
2.9 KiB
PRD - 多模态视觉理解
REQ编号: REQ-AI-003 版本: v1.0 优先级: P2 阶段: 中期(3-4个月) 作者: 宋献 日期: 2026-07-19
一、问题陈述
用户问题:
- 员工遇到错误弹窗、蓝屏、代码报错等问题时,只能文字描述
- 文字描述往往不准确,AI 难以理解真实问题
- 导致问题解决效率低
业务目标:
- 员工上传截图后,AI 自动识别图片内容
- AI 根据图片给出诊断建议或解决方案
- 提升问题一次解决率
二、需求范围
2.1 核心功能
| 功能 | 描述 |
|---|---|
| 图片理解 | 上传截图后,AI 自动识别图片内容 |
| 错误识别 | 自动识别错误码、蓝屏、弹窗、日志等 |
| 诊断建议 | 根据图片内容给出诊断建议 |
| 多图支持 | 支持一次上传多张图片 |
2.2 非目标
- 不支持视频理解
- 不支持语音理解(后续迭代)
- 不支持图片编辑/标注
三、用户故事
| 角色 | 用户故事 | 验收标准 |
|---|---|---|
| 员工 | 我可以上传问题截图获取帮助 | 上传截图后,AI 自动分析并给出建议 |
| 员工 | 我可以一次上传多张图片 | 最多支持 4 张图片同时上传分析 |
| 坐席 | 我可以看到用户上传的图片 | 图片作为消息展示,点击可放大 |
四、功能详情
4.1 交互流程
员工上传图片 → AI视觉模型分析 → 识别问题类型 → 生成诊断建议 → 返回给用户
4.2 支持的图片类型
| 类型 | 示例 |
|---|---|
| 错误弹窗 | "连接失败"、"权限不足" |
| 蓝屏/黑屏 | Windows BSOD、系统崩溃 |
| 代码报错 | 编译器错误、运行时异常 |
| 日志截图 | 应用日志、服务器日志 |
| UI异常 | 界面显示异常、布局错乱 |
4.3 返回格式
{
"image_description": "Windows 10 蓝屏,错误代码 DRIVER_IRQL_NOT_LESS_OR_EQUAL",
"problem_type": "系统崩溃",
"diagnosis": "可能是驱动程序不兼容导致",
"suggestions": [
"尝试重启计算机",
"检查最近安装的驱动程序",
"使用系统还原恢复"
],
"confidence": 0.85
}
4.4 技术方案
- 调用视觉大模型 API(如 GPT-4V、Claude Vision)
- 图片先压缩再发送,控制成本
- 支持主流图片格式:JPG、PNG、GIF、BMP
五、指标设计
| 指标 | 目标 | 测量方式 |
|---|---|---|
| 图片理解准确率 | ≥ 75% | 识别结果被标记正确的比例 |
| 平均响应时间 | ≤ 5s | 上传图片到返回结果的时间 |
| 用户满意度 | ≥ 4.0 | 用户对AI理解结果的评价 |
六、技术依赖
| 依赖项 | 说明 |
|---|---|
| 视觉大模型 API | 图片理解能力 |
| 文件上传服务 | REQ-用户-002 |
七、关联文档
- 前置需求: REQ-用户-002 文件上传
- 后续需求: 无