通用文本 URL 去重提取工具 - 五岁小孩

加载中...

提取规则

链接在当前浏览器内完成识别与去重,不会上传文本内容。

待处理文本
原文字符 0
匹配链接 0
去重保留 0
重复移除 0
提取结果
把散落的网址整理成可用清单
网页资料、服务器日志和工作文档里常常夹着大量链接。将内容粘贴到上方,工具会找出网址、剔除末尾标点并保留首次出现的顺序。对于 www. 或没有协议的域名,可按需要统一补成 HTTPS 地址,再复制或下载为文本文件。
使用方式
1. 粘贴原文:支持普通文本、HTML 片段、Markdown、日志和混合格式内容。
2. 选择规则:需要识别裸域名时切换识别范围;也可决定是否清除锚点或常见统计参数。
3. 导出结果:点击“提取并去重”后,可调整分隔和排序方式,随后直接复制或下载 TXT。
常见问题

为什么网址末尾的逗号、句号不会被保留?

中文和英文正文中,链接往往紧接着标点。工具会移除常见的收尾标点,避免它们被误当作 URL 的一部分。

相同网址如何判定?

统一协议和域名大小写后进行精确比对,保留首次出现的链接;查询参数和路径不同的网址仍会分别保留。

处理内容会发送到服务器吗?

不会。识别、规范化、去重、复制和文件生成都由浏览器本地完成,刷新或关闭页面后内容不会被保存。