多模态输入
2026年8月15日大约 2 分钟
多模态输入
让 AI 看懂你的世界。Measix Pilot 支持图片、PDF、DOCX 等多种文档输入,让对话从文字扩展到视觉和文档。
支持的输入类型
🖼️ 图片输入
- 支持所有常见格式:JPG、PNG、GIF、WebP、BMP
- 现代格式:HEIC、HEIF、AVIF、ICO
- 支持图片裁剪后发送
- 多图批量发送
图片裁剪
发送图片前可进行裁剪,只发送你关注的区域,既节省流量又提高 AI 识别准确率。
📄 PDF 文档
- 支持 PDF 文本提取
- 支持多页 PDF
- 文本内容作为上下文传递给模型
📝 DOCX 文档
- 支持 Word 文档解析
- 保留段落结构和格式信息
- 提取文本和表格内容
工具结果图片回传
工具调用返回的图片会按模型输入模态回传,确保:
- 图片能正确传递给支持多模态的模型
- 不支持图片的模型会收到文字描述
- 多模态工具调用支持(如 Google API 的多媒体工具响应)
典型应用
图像理解
用户: [发送一张植物照片] "这是什么植物?怎么养?"
↓
AI: "这是龟背竹,属于天南星科..."文档分析
用户: [发送一份 PDF 财报] "总结一下这家公司的财务状况"
↓
AI: "根据财报数据,该公司..."表格识别
用户: [发送一张表格截图] "帮我把这个表格转成 Markdown"
↓
AI: [生成 Markdown 表格]使用建议
- 图片发送前裁剪到关键区域,提高 AI 识别准确率
- 大型 PDF 建议先提取关键页面,避免超出模型上下文限制
- 多图发送时,可以添加描述性文字帮助 AI 理解图片间的关系