这个页面把这件事收敛成一次点击:左边勾选想要的内容类型,右边贴上原文,结果就整整齐齐排好了。手机号、座机、邮箱、网址、身份证、银行卡、车牌、快递单号、经纬度、金额……23 种常见格式都在候选里,而且可以一次勾选多类同时抓取,不用切一次类型跑一遍。
更关键的是它不只做「长得像」的匹配。身份证要过加权模 11 的校验位和出生日期两道关,银行卡要过 Luhn 算法,统一社会信用代码要过模 31 校验,IPv4 每一段都要落在 0 到 255 之间。那些长度凑巧的工单号、物料编码、流水号会被明确拦下来,并计入右上角的「校验淘汰」计数,让你知道到底筛掉了多少。
第二步,贴上原文。右侧文本框不限格式,换行、制表符、中英文标点混排都能处理,直接从 Excel、微信、日志文件复制过来就行。
第三步,取走结果。输出可以按类型分组(每组带标题和命中条数),也可以合并成一列方便直接贴进表格。配合去重、排序、分隔方式三个开关调整格式,最后一键复制,或导出 TXT、CSV 文件。
| 分组 | 类型 | 识别要点 |
|---|---|---|
| 联系身份 | 手机号码 | 1 开头的 11 位号段,第二位限定 3-9 |
| 固定电话 | 按区号位数校验号码长度,允许分机后缀 | |
| 邮箱地址 | 标准 local@domain.tld 结构 | |
| QQ 号码 | 5 至 11 位、首位非零的数字 | |
| 身份证号 | 18 位校验位 + 出生日期双重核验,兼容 15 位老证 | |
| 网络地址 | 网址链接 | http/https 开头,自动在中文标点处截断 |
| 域名 | 常见顶级域白名单匹配,排除纯数字段 | |
| IPv4 地址 | 四段数值均需落在 0-255 区间 | |
| IPv6 地址 | 完整式与 :: 缩写式均可识别 | |
| MAC 地址 | 冒号或短横分隔的六组十六进制 | |
| 商务票据 | 银行卡号 | 13-19 位并通过 Luhn 算法校验 |
| 统一社会信用代码 | 18 位字母数字,登记部门码限定 + 模 31 校验 | |
| 车牌号码 | 覆盖民用、警车、使领馆及新能源 8 位牌 | |
| 快递单号 | 顺丰、圆通、中通、京东、极兔、EMS 等主流格式 | |
| 邮政编码 | 首位非零的 6 位数字 | |
| 金额 | 识别货币符号前缀与「元」后缀,支持千分位 | |
| 数值文本 | 日期 | 横杠、斜杠、点号及中文年月日四种写法 |
| 时间 | 时分秒,秒可省略 | |
| 经纬度 | 小数点后至少 4 位的坐标数值 | |
| 颜色值 | 三位或六位十六进制色值 | |
| 纯数字 | 整数与小数 | |
| 中文片段 | 两字及以上的连续汉字 | |
| 英文单词 | 两个字母及以上的连续字母串 |
明明有身份证号,为什么一条都没提取出来?
大概率是号码本身过不了校验。开启「校验位核验」时,第 18 位要满足加权模 11 的运算结果,第 7 到 14 位还要是真实存在的年月日,2024-02-30 这种日期会被判定为假。处理脱敏数据或自造的测试号时,把这个开关关掉即可退回纯格式匹配。
为什么同一串数字被多个类型同时抓到?
这是正常现象。11 位手机号本身也是一串纯数字,勾选「纯数字」时自然会同时出现在两个分组里。分组输出模式能清楚看到各自的归属;如果只想要一份干净清单,切换到合并模式并开启去重即可。
座机号会不会把工号、物料编码认错?
不会按 0 开头的数字串一刀切。工具按区号位数分别判断:3 位区号后跟 8 位号码,4 位区号后跟 7 或 8 位号码,并允许短横、空格分隔以及「转 8006」这类分机后缀。长度不符合规则的编号不会被收录。
网址后面为什么少了一截?
中文语境里网址常常紧挨着「,」「。」「)」等标点,工具会在这些字符处主动截断,避免把标点混进链接。如果原文里的链接本身带中文参数,建议先在链接前后加空格再提取。
结果条数上限是多少?会不会卡住?
单次输出最多保留 20000 条,超出部分会被截断并给出提示。十万字级别的文本在普通电脑上通常一秒内完成,若原文特别大,建议拆成几段分批处理,或先取消「纯数字」「英文单词」这类命中率极高的类型。
贴进去的内容会被上传吗?
不会。页面加载完成后,正则匹配、校验位计算、去重排序全部在你本机浏览器里执行,不发起任何网络请求,也不写入 Cookie 或远程日志。处理客户名单、订单明细这类敏感内容时,断网状态下同样可以正常使用。
