刷小红书你大概有过这种感觉:一篇笔记干货满满,步骤、清单、书单写得清清楚楚,可你想把它存下来,复制正文却只拿到一句"详细步骤见图"。抖音的图文合集和商品卡也一样——字看得到,复制不出来。小红书和抖音的配图文案提取(OCR)用法一致,本文以小红书为例,抖音操作相同。
现在小红书的图文笔记越来越习惯把核心信息做成图片卡片——分步骤的教程、按价格排的好物清单、一整页书单、产品参数对比,全是图。正文反而只写一两句话引导你往下翻。对读者来说排版好看、信息集中。但对做内容拆解、二创或归档的人来说,麻烦就来了:字看得到,复制不出来。
图片里的文字,到底怎么提出来
把图片上的文字转成可复制文本,说白了是一道 OCR(光学字符识别)题:给一张图,识别上面的文字,输出纯文本。难点不在识别本身,而在于小红书一篇图文封面加配图常有10多张,你得对每一张都识别,再把结果归拢到一起,还要和这篇笔记的标题、正文对上号。
目前能做这件事的路子大致有几种,各有各的妥协。
手机自带的截图取字最顺手。iPhone 长按图片、安卓的智能识屏,对单张图很方便,但一次只能处理一张,没法批量,更没法和笔记的标题、正文、评论合并归档。
各种在线 OCR 网站是第三条路。零散用还行,量一大就要排队、看广告或付费,而且图片得你自己一张张存下来再上传,又绕回手动的老路。
三条路要么卡在批量,要么卡在准确度,要么卡在还得手动搬图片。问题其实是同一个:图片文字和你已经在采集的那批笔记数据是脱节的。
用 MediaClaw 的配图文案提取,把图片文字回填到采集记录
如果你本来就在用插件采集小红书笔记,图片文字这件事可以顺手在同一个流程里解决。MediaClaw 从 V0.1.8 起,插件本体内置了配图文案提取(OCR):对一篇图文笔记的封面和每一张配图做 OCR,把图片里的文字识别出来,结果直接回填到这条笔记的采集记录里。
先交代一个前提。用插件采集到的笔记,默认只有标题、正文、互动数据、评论和媒体链接——也就是平台正文层面能拿到的东西,图片里的文字不在其中。配图文案提取补的就是这块:识别完成后,原本散在图片里的步骤、书单、价格、参数,会作为文本写回这条记录,让单篇笔记变成一份完整的原数据。
回填之后,这些图片文字和笔记其他字段在一起:查看时直接读到,复制时整段带走,导出 CSV 或 Markdown 时图片文案跟着出来,同步飞书多维表格时一并带过去。要强调的是,这套原数据建在插件本体里,不依赖飞书——飞书只是众多下游同步去处之一,你不开飞书也能用、能导出。
操作不复杂,三步:
- 在插件侧边栏对当前这篇图文笔记触发采集,拿到标题、正文、媒体链接等基础数据
- 对这条记录执行配图文案提取,插件会对封面和每张配图逐一做 OCR
- 识别结果回填记录,之后照常查看、复制、导出 CSV/Markdown 或同步飞书
抖音那边逻辑一样,抖音图文文案提取对合集图、商品卡同样逐张识别,图文和视频的原数据也支持这样补齐。两个平台都在做的话,同一套方式就能覆盖,不用换工具。想先把采集这步跑顺,可以从小红书笔记采集或抖音视频采集开始,采几篇再谈识别。
提完之后,这些文字能拿来做什么
把图片文字提出来只是第一步,它进了采集记录之后才真正有用。
最常见的是归档。一篇图片版书单笔记,OCR 之后整份书单变成可搜索文本,导出 Markdown 存进资料库,以后想找哪本书全文检索就行,不用再翻图。二创和拆解同理,把对标账号那些做成卡片的步骤、话术提成文字,你才能逐句分析它的结构、用了哪些词。说到词,小红书封面其实是埋词的重要位置,想顺带研究爆款封面都写了什么,可以看这篇小红书关键词布局攻略里讲的封面 OCR 埋词思路。
处理的如果是视频口播而不是图片文字,那是另一套方案:视频要提的是逐字稿。插件本体同样能一键提取小红书视频逐字稿,并输出带时间戳的分句节奏稿,方便对视频整体节奏做分析;想配合飞书多维表格和阿里百炼的免费额度跑,可以看短视频逐字稿提取那篇。图片文字和视频逐字稿这两件事,正好覆盖图文和视频两种笔记的原数据补齐。
想把整套流程跑通,先安装 MediaClaw 插件采几篇笔记,挑一篇图文触发配图文案提取,看看图里的书单或价目表识别得准不准,再决定要不要批量处理你那批对标笔记。采集和导出 Excel/CSV 这两步免费,可以先跑通再说——OCR 用得上再开。
常见问题
小红书把干货做成图片,怎么把图片里的文字提取出来? 对图片做 OCR 就行。用 MediaClaw 采集这篇笔记后,对它执行配图文案提取,插件会对封面和每张配图逐一识别,把文字回填到采集记录,之后直接复制或导出。OCR 属于付费能力,按额度计费;采集和导出 Excel/CSV 本身免费。
封面和配图上的文字,能不能批量提取成可复制的文本? 可以。配图文案提取会对一篇笔记的封面加每一张配图都识别,不是只识别一张,结果作为文本写回记录,导出 CSV 或 Markdown 时一并带出,方便整段复制和全文检索。
飞书多维表格自带的图片识别免费,为什么还要用插件的 OCR? 飞书自带的免费但准确率不稳,复杂图、艺术字、竖排文案容易出别字,提价格、书名、参数时错一个字就得返工。MediaClaw 的配图文案提取调用付费模型,识别更准。区别就是免费但不一定准,和付费但更准之间的取舍——内容敏感就选后者。
抖音图文的图片文字也能提取吗? 能。抖音侧同样支持图文和视频的原数据补齐,配图文案提取的用法和小红书一致,两个平台用同一套流程就能覆盖。



