手机号邮箱身份证快递单号批量提取 - 五岁小孩

加载中...

要抓取的内容
处理方式
校验位核验会对身份证、银行卡、统一社会信用代码、IPv4、日期做真实性判断,能挡掉大量假号码。
粘贴待处理的文本
原文字符 0
命中类型 0
提取条数 0
校验淘汰 0
提取结果
它替你省下的是什么
一份客户回执、一段群聊记录、一批快递面单文字,真正有用的往往只是散落其中的几十个号码和链接。过去的做法是肉眼一行行扫、鼠标一个个框选,抄错一位就得从头核对。

这个页面把这件事收敛成一次点击:左边勾选想要的内容类型,右边贴上原文,结果就整整齐齐排好了。手机号、座机、邮箱、网址、身份证、银行卡、车牌、快递单号、经纬度、金额……23 种常见格式都在候选里,而且可以一次勾选多类同时抓取,不用切一次类型跑一遍。

更关键的是它不只做「长得像」的匹配。身份证要过加权模 11 的校验位和出生日期两道关,银行卡要过 Luhn 算法,统一社会信用代码要过模 31 校验,IPv4 每一段都要落在 0 到 255 之间。那些长度凑巧的工单号、物料编码、流水号会被明确拦下来,并计入右上角的「校验淘汰」计数,让你知道到底筛掉了多少。
三步走完整个流程
第一步,选定目标。左侧按「联系身份 / 网络地址 / 商务票据 / 数值文本」分成四组,点亮需要的标签即可。拿不准就先点全选跑一遍,看看哪些类型有命中,再回过头精简。

第二步,贴上原文。右侧文本框不限格式,换行、制表符、中英文标点混排都能处理,直接从 Excel、微信、日志文件复制过来就行。

第三步,取走结果。输出可以按类型分组(每组带标题和命中条数),也可以合并成一列方便直接贴进表格。配合去重、排序、分隔方式三个开关调整格式,最后一键复制,或导出 TXT、CSV 文件。
支持识别的 23 种内容
分组类型识别要点
联系身份手机号码1 开头的 11 位号段,第二位限定 3-9
固定电话按区号位数校验号码长度,允许分机后缀
邮箱地址标准 local@domain.tld 结构
QQ 号码5 至 11 位、首位非零的数字
身份证号18 位校验位 + 出生日期双重核验,兼容 15 位老证
网络地址网址链接http/https 开头,自动在中文标点处截断
域名常见顶级域白名单匹配,排除纯数字段
IPv4 地址四段数值均需落在 0-255 区间
IPv6 地址完整式与 :: 缩写式均可识别
MAC 地址冒号或短横分隔的六组十六进制
商务票据银行卡号13-19 位并通过 Luhn 算法校验
统一社会信用代码18 位字母数字,登记部门码限定 + 模 31 校验
车牌号码覆盖民用、警车、使领馆及新能源 8 位牌
快递单号顺丰、圆通、中通、京东、极兔、EMS 等主流格式
邮政编码首位非零的 6 位数字
金额识别货币符号前缀与「元」后缀,支持千分位
数值文本日期横杠、斜杠、点号及中文年月日四种写法
时间时分秒,秒可省略
经纬度小数点后至少 4 位的坐标数值
颜色值三位或六位十六进制色值
纯数字整数与小数
中文片段两字及以上的连续汉字
英文单词两个字母及以上的连续字母串
常见问题

明明有身份证号,为什么一条都没提取出来?

大概率是号码本身过不了校验。开启「校验位核验」时,第 18 位要满足加权模 11 的运算结果,第 7 到 14 位还要是真实存在的年月日,2024-02-30 这种日期会被判定为假。处理脱敏数据或自造的测试号时,把这个开关关掉即可退回纯格式匹配。

为什么同一串数字被多个类型同时抓到?

这是正常现象。11 位手机号本身也是一串纯数字,勾选「纯数字」时自然会同时出现在两个分组里。分组输出模式能清楚看到各自的归属;如果只想要一份干净清单,切换到合并模式并开启去重即可。

座机号会不会把工号、物料编码认错?

不会按 0 开头的数字串一刀切。工具按区号位数分别判断:3 位区号后跟 8 位号码,4 位区号后跟 7 或 8 位号码,并允许短横、空格分隔以及「转 8006」这类分机后缀。长度不符合规则的编号不会被收录。

网址后面为什么少了一截?

中文语境里网址常常紧挨着「,」「。」「)」等标点,工具会在这些字符处主动截断,避免把标点混进链接。如果原文里的链接本身带中文参数,建议先在链接前后加空格再提取。

结果条数上限是多少?会不会卡住?

单次输出最多保留 20000 条,超出部分会被截断并给出提示。十万字级别的文本在普通电脑上通常一秒内完成,若原文特别大,建议拆成几段分批处理,或先取消「纯数字」「英文单词」这类命中率极高的类型。

贴进去的内容会被上传吗?

不会。页面加载完成后,正则匹配、校验位计算、去重排序全部在你本机浏览器里执行,不发起任何网络请求,也不写入 Cookie 或远程日志。处理客户名单、订单明细这类敏感内容时,断网状态下同样可以正常使用。