Skip to content

Proposal:AI输入标准化 #62

Description

@LUPENGHAN

Issue:AI 输入标准化

1. 功能描述

MVP 支持三类 AI Tab 输入:文本、语音、主动上传图片。

输入标准化模块只负责把不同输入变成文本,再交给主 Agent。它不做业务意图判断,不生成 Schedule / Todo / Goal / Task 候选,也不直接写入数据库。

2. 用户 / 用户故事

目标用户:需要通过文字、语音或主动上传图片快速表达时间管理意图的个人用户。

  • 用户打字:“明天下午三点开会。”
  • 用户说话,系统 ASR 转成文字后进入 AI。
  • 用户主动上传聊天截图,系统 OCR 出文字后进入 AI。

三种输入最终都被主 Agent 当作文本请求处理。

3. 现有做法及不足

如果不先把语音和图片统一成文本,主 Agent 就需要同时理解多模态内容和业务意图,入口会变复杂。

本模块只负责把不同输入标准化成文本,不做业务意图判断,不直接创建业务候选。

4. 本期范围

  1. 文本输入直接进入主 Agent。
  2. 语音输入先经 ASR 转文字。
  3. 主动上传图片先经 OCR 转文字。
  4. 转换失败时展示错误,不创建业务候选。

5. 明确不做

  • 不做后台监听。
  • 不做通知栏一键读取图片。
  • 不做任意界面无障碍截屏。
  • 不做自由图片理解和图片语义推理。
  • 不把 OCR / ASR 结果自动写入业务对象。
  • 不做第三方 IM、邮箱或日历聚合导入。

6. 关键决策

决策点 备选方案 选择 理由
输入归一化 全部转文本 / 各模态直接进入业务 Agent 全部转文本 降低主 Agent 输入复杂度
图片范围 主动上传 OCR / 自由图片理解 / 后台截屏 用户主动上传 OCR 控制隐私与权限风险
业务判断 主 Agent 处理 / OCR、ASR 直接创建对象 主 Agent 处理 OCR / ASR 不理解业务对象

7. 边界与异常

  • ASR 失败:提示重新录音或改用文字。
  • OCR 失败:提示重新上传或手动输入。
  • OCR 结果为空:不进入主 Agent。
  • 用户编辑转写文本后,以编辑后的文本为准。
  • 图片中包含多个事项时,由主 Agent 后续拆成候选并让用户确认。

8. 基本概念与信息结构

RawInput
├─ text
├─ voice -> ASRResult -> NormalizedText
└─ image -> OCRResult -> NormalizedText

NormalizedText -> 主 Agent

9. 验收标准

  • 文本输入可直接进入 AI Tab 消息流。
  • 语音输入成功后展示转写文本,并可继续由主 Agent 处理。
  • 图片 OCR 成功后展示识别文本,并可继续由主 Agent 处理。
  • 用户可在发送前修改 ASR / OCR 文本。
  • ASR / OCR 失败不会产生 Schedule / Todo / Goal / Task 候选。
  • 子 Agent 接收到的输入已经是主 Agent 封装后的完整参数,而不是原始音频或图片。

Metadata

Metadata

Assignees

No one assigned

    Type

    No type

    Projects

    No projects

    Relationships

    None yet

    Development

    No branches or pull requests

    Issue actions