# 🗓️ AI 学习卡片 · 2026-08-02（周日）

> 系列进度：AI Agent（7/28）→ RAG（7/29）→ 本地部署 Ollama（7/30）→ Prompt 工程进阶（8/1）→ **多模态（今天）**

---

## 1️⃣ 今日主题：多模态大模型 —— 让 AI 真正"看懂"图片

**一句话**：多模态（Multimodal）模型能同时理解**文字 + 图片**（部分还支持音频/视频），不再是"只会聊天的文字机器"，而是能看图、读表、识屏的"全能助手"。

**为什么值得学（3 个理由）**：
- **刚需场景最多**：截图报错、产品图分析、表格识别、证件/单据信息提取、装修图参考……这些"图"的问题，纯文字模型答不了，多模态一行就解决。
- **和前面学的串起来了**：用 7/30 装的 **Ollama 本地跑多模态模型**（如 `llava`、`qwen2.5-vl`），既能免费离线看图，又能用 8/1 的"四要素提示词"把看图任务说得明明白白。
- **当下最热方向**：GPT-4o、Gemini、通义千问 VL、豆包视觉都是多模态；"'AI 能看懂世界'是这一轮 AI 落地的最大增量"，早懂早用。

---

## 2️⃣ 学习资源（直接点开搜索，挑最新/播放量高的看 5–10 分钟）

| 平台 | 搜索链接 |
|------|----------|
| 📺 B站 | https://search.bilibili.com/all?keyword=多模态大模型%20视觉理解 |
| 🎵 抖音 | https://www.douyin.com/search/%E5%A4%9A%E6%A8%A1%E6%80%81%E5%A4%A7%E6%A8%A1%E5%9E%8B |
| 📕 小红书 | https://www.xiaohongshu.com/search_result?keyword=多模态AI%20实用技巧 |

> 建议关键词组合：多模态 + "实用 / 办公 / 本地部署 / Qwen2.5-VL"，更易找到能上手的内容。

---

## 3️⃣ 今日小任务（动手 10 分钟）

**任务：用"看图四要素提示词"让 AI 读懂一张图**

1. **准备一张图**：随手截一张你的软件报错界面 / 一张待整理的数据表格 / 一张想分析的截图。
2. **发给任意多模态模型**（网页版 GPT-4o / 通义千问 VL / 豆包，或本地 `ollama run qwen2.5-vl`），并套用学过的四要素提示词：
   > 角色：你是一位资深数据分析师。
   > 任务：请读取这张图里的表格数据。
   > 约束：用 Markdown 表格还原内容，并指出 1 个明显异常值。
   > 示例：（贴一行期望格式）
3. **对比验证**：先随便说"帮我看下图"，再换成上面的四要素版，感受"会说话"和"会下指令"的差距。
4. **存档**：把这次成功的提示词丢进你 8/1 建的提示词模板库，打上 `#多模态` 标签。

✅ 完成标准：AI 准确还原了图里的内容，且你存下了一条可复用的多模态提示词。

---

💡 **明日预告**：AI 工作流编排（把 Agent + RAG + 多模态串成一条自动化流水线）。
