名片

名片怎么数字化(以及为什么大多数做法都会失败)

一张排版凌乱的名片,旁边是它被解析后的结果,以手机画面的形式放在深色的编辑式封面框内

名片数字化的做法是:拍照或扫描名片,让软件抽取印好的栏位,检查更正之后再存档。抽取是简单的那一步。大多数做法失败在之后——六个月后你最需要的那几个栏位,名片上从来就没印过,而软件推断出来的那些,往往会被悄悄丢掉。

扫描名片后的检查画面,显示五个抽取出来的栏位,等待确认后存档

一句话版本

  • 把一张干净的名片数字化,大约是七次点击、15 到 20 秒。抽取不是瓶颈,而且已经很多年都不是了。
  • 扫一张名片会拿回五个栏位:名字、职称、公司、电话、邮箱。那就是一张名片物理上装得下的全部。
  • 你六个月后真正需要的栏位——怎么认识的、他开口要什么、聊得顺不顺——不在名片上,也没办法从名片上抽出来。
  • 抽取之后的每一个环节,才是数字化真正会失败的地方:需要人工更正的栏位、被静静丢掉的值,以及根本没进到存储的信息。
  • 这两种失败,我都在自己的系统里测出来了。下面有具体的细节。

一张名片要怎么数字化?

这是我做的那套系统里,老实数出来的实际路径。

打开选单,点 Quick Add,点 CARD 分页(预设就开在那里),点「扫描名片照片」,相机打开,按快门,确认照片。模型大约两到三秒读完,中间我一下都不用点。抽取出来的栏位出现,等你检查。点存档。

干净的名片是五次点击,加上存档那一次,再加上更正栏位要花的几次。干净名片的实际总数:大约七次点击,从头到尾 15 到 20 秒。

排版凌乱的名片,再加 15 到 30 秒的更正。

任何像样的扫描 app 都在这个区间。如果有人拿「记录速度」在卖你东西,他卖的是一个已经解决了的问题。

名片扫描器到底抽得到什么?

五个栏位。名字、职称、公司、电话、邮箱。

这不是模型的限制——是名片的限制。名片是一张印着联络资料的长方形纸。它上面没有你们怎么认识、聊了什么、这个人在找什么,也没有你想不想跟他合作。

所以我做了第二条输入路径。不用名片,你用一两句话描述这个人,解析会回来十二个栏位而不是五个:名字、职称、公司、电话、邮箱、行业、特质、怎么认识的、感觉评分、摘要、他在找什么、他能提供什么。

  • 拿回几个栏位
    • 扫名片:5
    • 用一句话描述:12
  • 数据从哪里来
    • 扫名片:印好的名片
    • 用一句话描述:你对那次见面说了什么
  • 记录要多久
    • 扫名片:15–20 秒(干净的名片)
    • 用一句话描述:30–45 秒把那段话想好写完
  • 解析要多久
    • 扫名片:约 2–3 秒
    • 用一句话描述:约 2–3 秒
  • 记得住怎么认识的吗
    • 扫名片:不能
    • 用一句话描述:可以
  • 记得住他要你做什么吗
    • 扫名片:不能
    • 用一句话描述:可以,只要它活得过存档那一步
  • 最适合
    • 扫名片:名片就在你手上,此时此刻
    • 用一句话描述:没拿到名片就认识的人,或者一段值得留下来的对话

名片那条路比较快。句子那条路,是唯一能记下你之后真正会缺的那一块的。这个取舍就是这整篇文章的论点,也是为什么「把名片数字化」这句建议,比听起来要糟。完整的六种方法比较在名片怎么整理

每一次我都得手动修的是什么?

四件事,按出现频率排。

行业——基本上每次。名片那条路的结构里根本没有行业这个栏位,因为名片从来不会写。句子那条路模型确实会推断,而且推得很好;有一次测试它从上下文正确推出了「物流」。但我的 app 只有在值完全符合一份十一项的固定清单时才会保留,而提示词从来没告诉模型那份清单里有什么。于是一个正确的答案被静静丢掉,栏位显示成一个横杠。那是我的 bug,不是模型的。

惯用称呼——从来没填上过。没有办法抽取。名片不会写一个人喜欢别人怎么叫他。介面自己的文案有讲明这件事,这至少算诚实。

名字和职称的清理——大约每三四张一次。真实的名片上会有引号里的小名,还有叠在一起的职称。印成 Jonathan "Jonty" Reyes-Whitfield 的名字会原封不动变成一整串,连引号一起。写着 Co-Founder & Creative Director / Interim Ops Lead 的职称会完整传过来,需要手动拆开。

电话号码的标点——美式格式的号码几乎必中。服务器会去掉连字号和空格,但不会去掉括号,所以印成 +1 (415) 555-0192 的号码会存成 +1(415)5550192。小事,但还是得动一下手。

一张排版凌乱的名片,旁边是它的解析结果:引号里的小名被原样保留,电话号码的标点没处理干净

这些都不是抽取失败。每一次模型都正确地读出了名片。它们是数据在那之后发生了什么的失败——而那正是数字化真正坏掉的地方。

那些名片本来就装不下的东西,最后怎么了?

这一段改变了我对整个类别的看法,而它是我自己系统里的一个缺陷。

我描述了一位联络人,他跟我讲过两件很具体的事:他在找仓储作业的软件供应商,还有他想认识货运科技那边的人。解析处理得完全正确——那两件事以结构化的「需求」回来,分得清清楚楚,跟设计的一模一样。数据库里有专门放需求和供给的表。也有一个接受它们的端点。

然后,存档程序在组装 payload 之前,从来没有去读解析结果里的那两项。它们没有被存下来,也没有被并进摘要文字里,就这样消失了。任何「她需要 X,之后跟进 Y」形式的东西,一按下存档就再也救不回来。

所以我的系统把那一整个星期里,别人跟我说过的最能拿来行动的一句话抽了出来,然后扔掉,而且什么都没告诉我。

我把这件事写出来,是因为它可以推而广之。联络人数字化里真正有意思的失败,几乎从来不在「读」这一步。从名片上读出文字是个已经解决的问题,而且解决好一阵子了。失败发生在抽取和存储之间的那段管线——把有效值丢掉的枚举不匹配、结构里没有位置的栏位,以及组装时漏掉解析器找到的某一块的 payload。这些失败在设计上就是无声的。没有报错。记录存好了。你要到几个月后,去找一件你确信自己记录过的东西时,才会发现。

一个人用手机扫描马来西亚名片的实景照片,画面显示五个抽取出来的联络栏位,旁边是名片上找不到的关系细节:在哪里认识、聊了什么、这个人需要或能提供什么

如果你在评估这类工具,这就是该测的地方。输入一件具体而且有用的事。存档。隔天再回来看它还在不在。

「系统抽出了什么」和「系统留下了什么」之间的落差,就是我把 Habitus Mind 做成现在这样的原因:每个人只有一笔记录,之后每一次见面都并进同一份有日期的纪录,而不是另开一笔;跟进日期由你自己在还记得原因的时候设定。它不去解读任何人,只把在的东西抽出来归档——而在它没做到的地方,像上面那样,我宁可把它写下来。

Habitus Mind 采用邀请制,由管理员审核,没有公开注册。索取邀请

扫描和描述,哪个比较快?

扫描,而且快不少——前提是名片就在你手上。

一张干净的名片,从头到尾 15 到 20 秒,包含两到三秒的解析和扫一眼确认栏位。而要写出真正有内容的三四句话,需要 30 到 45 秒,因为「写」本身就是工作;之后的解析两条路都一样是两到三秒。

所以名片在你手上,就扫。句子那条路不是在比速度,从来也不是。它存在的理由,是那个你没拿到名片就认识的人,还有那段值得留下来的对话——那一块从来就没印在任何东西上。

常见问题

名片怎么数字化?

拍下名片,让软件抽取印好的栏位,检查,然后存档。在我自己的系统上,干净的名片大约七次点击、15 到 20 秒。抽取本身两到三秒,而且很少是问题所在。

一张名片上能抽出哪些信息?

五个栏位:名字、职称、公司、电话、邮箱。那就是名片物理上装得下的东西。行业、怎么认识的、这个人需要什么、那次对话顺不顺,都没办法从名片上抽出来,因为它们从来就没印在上面。

名片可以扫进 Excel 吗?

可以——大部分扫描工具都能汇出 CSV,用 Excel 打得开。限制不在汇出。一张每人五个印刷栏位的表格,是一本整齐一点的通讯录,它还是不会告诉你这些人当初为什么重要。

为什么名片扫描器会把名字弄错?

通常它没弄错。它准确地抄了名片,包括引号里的小名和叠在一起的多重职称,因为名片上印的就是那样。大约每三四张会需要事后手动把名字或职称拆开、修掉。

名片数字化最大的问题是什么?

抽取之后的无声数据流失。值会因为结构不匹配而被丢掉,或者在解析和存档之间掉了,而且不会显示任何错误。这两种我都在自己的系统里找到了。测任何工具的方法:存一件具体的事,隔天回来看它还在不在。

HM

Habitus Mind Team

产品与研究

我们在马来西亚打造 Habitus Mind — 一个由 AI 驱动的私人人脉管理与健康记录系统。这个博客写的是我们在做什么,以及为什么这样做。

不想再忘记自己见过谁?

Habitus Mind 采用邀请制。送出申请,管理员会亲自看过。

索取邀请