Issue:AI 输入标准化
1. 功能描述
MVP 支持三类 AI Tab 输入:文本、语音、主动上传图片。
输入标准化模块只负责把不同输入变成文本,再交给主 Agent。它不做业务意图判断,不生成 Schedule / Todo / Goal / Task 候选,也不直接写入数据库。
2. 用户 / 用户故事
目标用户:需要通过文字、语音或主动上传图片快速表达时间管理意图的个人用户。
- 用户打字:“明天下午三点开会。”
- 用户说话,系统 ASR 转成文字后进入 AI。
- 用户主动上传聊天截图,系统 OCR 出文字后进入 AI。
三种输入最终都被主 Agent 当作文本请求处理。
3. 现有做法及不足
如果不先把语音和图片统一成文本,主 Agent 就需要同时理解多模态内容和业务意图,入口会变复杂。
本模块只负责把不同输入标准化成文本,不做业务意图判断,不直接创建业务候选。
4. 本期范围
- 文本输入直接进入主 Agent。
- 语音输入先经 ASR 转文字。
- 主动上传图片先经 OCR 转文字。
- 转换失败时展示错误,不创建业务候选。
5. 明确不做
- 不做后台监听。
- 不做通知栏一键读取图片。
- 不做任意界面无障碍截屏。
- 不做自由图片理解和图片语义推理。
- 不把 OCR / ASR 结果自动写入业务对象。
- 不做第三方 IM、邮箱或日历聚合导入。
6. 关键决策
| 决策点 |
备选方案 |
选择 |
理由 |
| 输入归一化 |
全部转文本 / 各模态直接进入业务 Agent |
全部转文本 |
降低主 Agent 输入复杂度 |
| 图片范围 |
主动上传 OCR / 自由图片理解 / 后台截屏 |
用户主动上传 OCR |
控制隐私与权限风险 |
| 业务判断 |
主 Agent 处理 / OCR、ASR 直接创建对象 |
主 Agent 处理 |
OCR / ASR 不理解业务对象 |
7. 边界与异常
- ASR 失败:提示重新录音或改用文字。
- OCR 失败:提示重新上传或手动输入。
- OCR 结果为空:不进入主 Agent。
- 用户编辑转写文本后,以编辑后的文本为准。
- 图片中包含多个事项时,由主 Agent 后续拆成候选并让用户确认。
8. 基本概念与信息结构
RawInput
├─ text
├─ voice -> ASRResult -> NormalizedText
└─ image -> OCRResult -> NormalizedText
NormalizedText -> 主 Agent
9. 验收标准
- 文本输入可直接进入 AI Tab 消息流。
- 语音输入成功后展示转写文本,并可继续由主 Agent 处理。
- 图片 OCR 成功后展示识别文本,并可继续由主 Agent 处理。
- 用户可在发送前修改 ASR / OCR 文本。
- ASR / OCR 失败不会产生 Schedule / Todo / Goal / Task 候选。
- 子 Agent 接收到的输入已经是主 Agent 封装后的完整参数,而不是原始音频或图片。
Issue:AI 输入标准化
1. 功能描述
MVP 支持三类 AI Tab 输入:文本、语音、主动上传图片。
输入标准化模块只负责把不同输入变成文本,再交给主 Agent。它不做业务意图判断,不生成 Schedule / Todo / Goal / Task 候选,也不直接写入数据库。
2. 用户 / 用户故事
目标用户:需要通过文字、语音或主动上传图片快速表达时间管理意图的个人用户。
三种输入最终都被主 Agent 当作文本请求处理。
3. 现有做法及不足
如果不先把语音和图片统一成文本,主 Agent 就需要同时理解多模态内容和业务意图,入口会变复杂。
本模块只负责把不同输入标准化成文本,不做业务意图判断,不直接创建业务候选。
4. 本期范围
5. 明确不做
6. 关键决策
7. 边界与异常
8. 基本概念与信息结构
9. 验收标准