Multimodal Input
多模态输入
统一管理文本、图片、音频和文件的上传、理解范围与引用关系。
何时使用:任务依赖图片、文档、音频或多种输入共同提供上下文。
Pattern anatomyLIVE TASK MODEL
ACTIVE RUN
多模态输入
1
Asset
2
Preview
3
Scope
4
Extraction
适用任务
文件分析视觉问答语音与图像理解
关键构成
- 01Asset
- 02Preview
- 03Scope
- 04Extraction
反模式
上传后只显示文件名,用户不知道系统读到了什么、哪些内容被忽略。
Task flow
从触发到完成
- 01接收并预览素材
- 02解释可读取范围
- 03提取结构化内容
- 04在回答中定位引用
State contract
必须显式呈现的状态
UploadingSTATE_01
ProcessingSTATE_02
ReadySTATE_03
PartialSTATE_04
UnsupportedSTATE_05
Success metrics
上线后看什么
↗处理成功率
↗提取覆盖率
↗用户纠错率
恢复策略
处理失败要区分格式、大小、权限和内容问题,并允许替换、裁剪或只处理选中区域。