HTML转文本 在线去除HTML标签提取纯文本
一键去除网页、邮件或文档中的HTML标签,把HTML转成纯文本,保留段落结构,可复制或保存为TXT,也支持直接打开本地文件。
更新于 2026-08-16
相关工具
功能特性
- 一键去除网页源码、邮件或文档中的所有 HTML 标签
- 得到干净的纯文本,方便编辑、分析或重新发布
- 自动移除 script 和 style 代码块,避免代码混入正文
- 保留段落和换行结构,标题、列表、段落清晰可读
- 表格单元格以制表符分隔,可直接导入 Excel 或 Google Sheets
- 解码 HTML 实体:& 变为 &, 变为空格
- 自动合并多余空行,输出整洁的段落
- 一键复制结果到剪贴板,或保存为 TXT 文件
- 直接打开本地 .html、.htm 或 .txt 文件
- 状态栏显示体积压缩比例,直观了解剥离效果
- 输入即转换,实时显示行数和字符数
使用方法
- 1在左侧面板粘贴 HTML 源码,或点击「打开文件」加载 .html、.htm 或 .txt 文件。
- 2右侧面板会随输入实时显示剥离后的纯文本。
- 3保持「移除脚本与样式」开启,自动删除 script 和 style 代码块。
- 4保持「保留换行」开启,段落、列表和标题会转为换行而不是挤成一大段。
- 5保持「解码实体」开启,& 会变为 &、 会变为空格;关闭则保留原始实体代码。
- 6开启「合并空行」将多个连续空行合并为整洁的单一换行。
- 7点击「复制」将提取的文本复制到剪贴板,或点击「保存 TXT」下载为 .txt 文件。
- 8使用示例按钮体验工具对完整文章和含脚本的杂乱网页的处理效果。
- 9查看状态栏中的输入/输出行数和体积比例,了解转换效果。
常见问题
为什么 html转文本工具不能保留网页格式?
因为 HTML 标签剥离器的定位就是纯文本:它会移除 <p>、<div>、<a>、<span> 等标记,只保留可见文本,加粗、斜体、颜色等格式都会丢失。做搜索索引、文本分析或邮件正文时,纯文本正是你需要的;要保留格式,请用本站的 HTML 转 Markdown 工具,它能保留加粗、斜体、标题和链接。
会移除 script 和 style 内容吗?
会。开启「移除脚本与样式」(默认开启)后,整个 script、style、noscript 和 template 代码块都会被删除,包括其中的内容。否则脚本内容会以原始 JavaScript 形式出现在输出中。
能保留段落和标题结构吗?
开启「保留换行」后,段落、标题、列表项、div 和表格行等块级元素会转换为换行;br 标签转为换行、hr 转为段落分隔符。文本会保持原有结构,而不是挤成一大段。
& 这样的 HTML 实体如何处理?
「解码实体」(默认开启)会把 & 转为 &、< 转为 <、> 转为 >、" 转为引号、 转为空格,以及数百个命名实体和 © 这样的数字实体转为真实字符。关闭该选项则保留原始实体代码。
可以处理邮件源码吗?
可以。在邮件客户端中查看邮件源码并粘贴到这里,即可提取纯文本。工具会剥离营销邮件常用的表格布局标记,保留可读的正文内容。
表格会如何处理?
表格单元格以制表符分隔、行以换行分隔,输出为干净的制表符分隔文本,可直接粘贴到 Excel 或 Google Sheets 中。如果希望所有内容连成一段,关闭「保留换行」即可。
会保留链接吗?
工具保留链接文本(页面上看到的文字),但会移除 a 标签本身和 href 属性。如果还需要保留 URL,建议使用 HTML 转 Markdown 工具,它能把链接保留为 [text](url) 格式。
Power Automate 里怎么把 HTML 转成文本?
Power Automate 的高级连接器提供现成的 HTML to text 操作,也可以用 Compose 操作加正则 <[^>]*> 去掉标签。只是临时转一次的话,把源码粘贴到本工具比搭一个流更快,得到的是同样的干净文本。
JavaScript 或 npm 包怎么把 HTML 转文本?
浏览器里一行搞定:new DOMParser().parseFromString(html, 'text/html').body.textContent 即可提取可见文本。需要更多控制(表格、链接、实体)时,html-to-text、turndown 等 npm 包能处理这些情况。本工具在本地做了同样的事,无需配置。
可以不粘贴而直接打开文件吗?
可以。点击「打开文件」从电脑中选择 .html、.htm 或 .txt 文件,文件会在浏览器本地读取,内容自动填入输入面板,无需上传。
保存的文件是什么格式?
「保存 TXT」会将提取的文本下载为 UTF-8 编码的纯文本 .txt 文件,可用任何文本编辑器、文字处理软件或文档工具打开。
为什么 html转文本后文本长度几乎没变?
体积比例是 html 转文本后输出长度与输入的比值。如果页面本身以纯文本为主、标记很少,比例会接近 90%–100%,删掉的只有标签,文字本身不变,这是正常的。脚本、样式和属性较多的页面通常能降到原始大小的 20%–40%,此时可开启「合并空行」进一步收紧空白。
为什么输出里还有 © 这样的代码?
请检查「解码实体」是否开启:它会将数百种命名实体(&、<、")和数字实体(©、€)转换为真实字符。仍未转换的通常是格式错误或非标准实体,它们没有定义对应的字符,工具会原样保留而不是猜测。您也可以用 HTML 实体编码工具检查原始输入中实际包含哪些代码。
转换后文本是空的或缺了一大半,为什么?
最常见的原因是 JavaScript 渲染的内容:单页应用和懒加载页面在运行时才用 JS 画出文字,HTML 源码里根本没有可提取的文本。解决办法:在渲染完成的页面上全选(Ctrl+A)复制可见文字再粘到这里;只有确定是服务端渲染的页面才用「查看源代码」。iframe 里的内容必须从 iframe 自身复制。
转换结果还有多余空行和空格,怎么彻底清理?
开启「合并空行」(把连续空行合并为一个)并保持「保留换行」开启;剩下的残留用任意文本编辑器的查找替换处理:把两个以上连续空格替换为一个,或用 ^\s+$ 这类正则删掉纯空白行。如果混乱来自源文件本身(每个标签之间都有空格),选项设置治不了页面本身的问题,清理的是文本,不是工具设置。
粘贴新内容把原来的 HTML 覆盖了,还能找回吗?
不能。本页不保留历史、不写盘,输入被替换后旧源码就从这个工具里消失了。如果原来是从文件打开的,磁盘上的文件没被动过:重新打开即可。如果是复制的,重新复制一次。以后建议:先把结果复制走,再往输入框粘贴新内容;需要重新读文件时用「打开文件」按钮。