网站 / SEO · SEO 工具

关键词密度

文本→词频/密度/TF-IDF

本地处理 · 不上传 免费 · 无需登录 无次数限制 累计 55 次使用
文本 → 词频 / 密度 / TF-IDF · 全本地分析
待分析文本 paste text or HTML
可视化Top-N 频率柱状图 · 关键词云
Top-12 频率柱状图 frequency bars
关键词云 字号 ∝ 频率
词频密度表frequency · density · ranking
#关键词次数密度%占比TF-IDF
输入文本后将在此显示词频、密度与 TF-IDF。
密度 = 该词出现次数 ÷ 总词元数 ×100%;TF-IDF 以文内句子为文档集计算(无外部语料,为文内相对权重,越高代表越具区分度)。SEO 经验:核心词密度 2–5% 较自然,超 8% 易判堆砌。
就绪 · 粘贴文本即时分析
第一节

关于本工具

About

写文章时,一个词出现几次才算「堆砌」?关键词密度工具不回答这个主观问题,它只做一件事:把一段文本拆成词,算出每个词出现的次数、占总词数的百分比,以及 TF-IDF 值——后者能过滤掉「的」「了」这类高频但无意义的词。所有计算在浏览器本地完成,文本不会被上传。适合写页面标题前快速检查核心词占比、或对比两版文案的用词集中度。

使用场景

SEO标题字数取舍

运营小王在写一篇3000字的行业深度稿,标题栏只能放30个汉字。他需要判断「2025年AI芯片格局」和「国产AI芯片突围战」哪个词频策略更优。用本工具的TF-IDF功能对比两个标题,发现「AI」在全文出现47次但IDF值低,而「突围」虽只出现6次但IDF权重高,最终选后者让点击率提升22%。

竞品详情页反推

电商运营老李发现竞品A的详情页「抗菌」出现12次、「除螨」出现9次,怀疑对方在堆砌关键词。他把自己产品页的文案导入工具,计算词频分布,发现「抗菌」密度仅1.3%而竞品达4.7%,接近搜索引擎的堆砌阈值。据此调整自家文案,将核心词密度控制在2-3%的安全区间,避免了被降权风险。

论文摘要精炼检查

研究生小陈写完5000字论文初稿,导师要求摘要突出「深度学习在医学影像分割中的应用」这个主题。他用工具扫描摘要,发现「分割」出现5次、「影像」出现3次,而「深度」只出现1次。按TF-IDF权重排序后,把摘要中「基于卷积神经网络的方法」改为「基于深度学习的影像分割方法」,使核心术语密度从0.8%提升至2.1%,更符合学术检索习惯。

广告文案合规自检

法务专员小赵审核一篇保健品推文,发现「疗效」出现8次、「治愈」出现3次,但法规禁止医疗用语。用本工具统计全文词频,把「疗效」替换为「调理效果」、「治愈」替换为「改善」,同时用TF-IDF验证替换后「调理」的权重是否足够覆盖原意。最终文案通过审核,且点击率未下降。

第二节

使用指南

Getting Started

使用步骤

  1. 1在文本框中粘贴或输入待分析内容(支持中英文混排,上限 10 万字符),下方实时显示总词数和唯一词数
  2. 2点击「词频」标签,结果按出现次数降序排列,每行显示词语、频次和占比百分比
  3. 3切换至「密度」标签,查看每个词语在全文中的密度百分比(词语出现次数 ÷ 总词数 × 100%)
  4. 4点击「TF-IDF」标签,对比当前文本与语料库的权重差异,高亮显示关键词(TF-IDF 值 > 0.1 标红)
  5. 5点任意结果行右侧的复制图标,将该词语及其密度值复制到剪贴板,用于后续 SEO 或内容优化

常见错误对照

1.把「词频」和「密度」混为一谈

✗ 错误「这个词出现了 5 次,密度就是 5」
✓ 修复「词频 5 次,总词数 100,密度 = 5 / 100 × 100% = 5%」

词频是原始出现次数,密度是相对比例。工具输出两个字段,把频次当密度会忽略文本长度对权重的影响。

2.分词粒度不一致导致 TF-IDF 失真

✗ 错误「关键词'数据分析',但工具按单字分词,把'数''据''分''析'当四个词算」
✓ 修复「先确认工具分词模式:若支持短语匹配,输入'数据分析';若仅单字,应改为'数据 分析'并手动合并结果」

TF-IDF 依赖分词粒度。单字分词会把复合词拆散,导致 IDF 分母虚高、TF 值偏低,最终权重偏离实际。

3.忽略停用词过滤对词频的影响

✗ 错误「'的'出现了 80 次,词频最高,所以关键词就是'的'」
✓ 修复「先启用停用词过滤,把'的''了''在'等高频无意义词剔除,再分析剩余实词」

中文停用词(如'的''是')占文本 30% 以上,不过滤会掩盖真正关键词。工具默认可能未开启过滤,需手动勾选。

4.用全角符号污染分词结果

✗ 错误「输入:'关键词,密度;测试。'(逗号、分号、句号全角)」
✓ 修复「输入:'关键词,密度;测试.'(全部半角标点)」

全角标点(,;。)在中文分词器中常被当作普通字符而非分隔符,导致粘连分词、词频统计偏大。

5.把 TF-IDF 当绝对重要性指标

✗ 错误「TF-IDF 值 0.8 的词一定比 0.6 的词更重要」
✓ 修复「TF-IDF 值仅在同一文档集合内相对排序有效,不同集合的值不可跨文本比较」

TF-IDF 是相对权重,依赖文档总数和词频分布。短文本的 TF 值天然偏高,长文本的 IDF 值更稳定,跨文本比较无意义。

6.输入包含 HTML 标签未预处理

✗ 错误「直接粘贴网页源码:<p>关键词密度</p>」
✓ 修复「先提取纯文本:'关键词密度'」

HTML 标签中的文本(如 <p>、<a>)会被当作正文内容统计,导致词频包含标签名(如 'p' 'a'),密度失真。

7.对同一文本重复计算密度

✗ 错误「同一篇文章复制粘贴 10 次,密度从 2% 变成 20%」
✓ 修复「只粘贴一次原始文本」

密度 = 词频 / 总词数。重复粘贴使总词数和词频同比例增加,密度不变,但用户误以为密度升高,混淆了频次和比例。

第三节

工作原理

How It Works

核心公式

TF-IDF(t,d) = TF(t,d) × IDF(t)

变量说明

  • TF(t,d)词 t 在文档 d 中的词频(出现次数/总词数)
  • IDF(t)逆文档频率,log(总文档数/含 t 的文档数+1)

示例

文档 d 共 200 词,词“优化”出现 8 次,则 TF=8/200=0.04。语料库总文档 1000 篇,含“优化”的文档 50 篇,则 IDF=log(1000/(50+1))≈log(19.61)≈1.292。TF-IDF=0.04×1.292≈0.0517。

输入文本分词 & 词频统计(浏览器内执行)去停用词 / 标点密度 / TF-IDF 计算结果所有计算在浏览器内完成文本不上传服务器
用户输入 本地处理 计算环节 输出结果
第五节

常见问题

Q & A
这个工具能分析中文关键词吗?会不会把单字拆开算?

可以,中文、英文、中英混排都支持。分词按空格和标点自然切分,中文不会拆单字,而是按词间空格、换行或标点来识别。如果文本里中文词之间没加空格,工具会把整句当一个词处理,密度就会偏大。建议中文文本先用空格或换行把每个词分开,或者直接粘贴已分好词的文本,结果才准。

我贴了 5000 字的文章,结果只显示前 1000 字的词频,后面的没算?

本工具是纯浏览器端处理,没有字数限制,但浏览器对超长文本的渲染和计算可能有卡顿。如果只显示部分结果,一般是浏览器内存或渲染限制。建议分段粘贴,每段 2000 字左右,或者把文本拆成多份分别分析。另外,工具不会截断,所有文本都会算,只是结果展示区可能滚动加载。

词频、密度、TF-IDF 这三个结果到底看哪个?

词频是每个词出现的绝对次数,适合快速看高频词。密度是词频占总词数的百分比,适合对比不同长度文本里的词重要性。TF-IDF 综合了词在文本中的频率和在整个语料库中的稀有度,适合从一堆文档里找出每篇的关键词。如果只分析一篇文章,密度比词频更有参考价值;如果分析多篇文章做对比,TF-IDF 更能挑出独特词。

为什么同一个词在别家工具算出来的密度不一样?

密度算法有差异:分母是总词数还是总字符数,分词规则不同(比如英文缩写 'I'm' 算一个词还是两个词),标点是否计入分母。本工具分母为总词数(按空格和标点切分后的词个数),标点不计入词数。如果别家把标点当词算,密度就会偏低。建议始终用同一工具做对比,跨工具比密度意义不大。

TF-IDF 结果里有的词分数很高,但我感觉它根本不重要,怎么回事?

TF-IDF 依赖你提供的语料库。如果只分析一篇文章,工具默认使用文章自身作为语料库,这时 IDF(逆文档频率)只能反映词在文章内部的稀有度。比如文章里只出现一次的生僻词,IDF 会很高,但实际可能不重要。要得到更合理的 TF-IDF,最好上传多篇文档作为语料库,本工具目前只支持单文本分析,单文本的 TF-IDF 仅供参考,建议结合词频和密度综合判断。

我把文章贴进去,点分析没反应,浏览器也没报错,怎么回事?

常见原因:1)文本太长导致浏览器卡死,等 10-15 秒没反应可以刷新重试,分短文本粘贴。2)粘贴的内容包含特殊字符或不可见控制符(如从 PDF 复制),工具分词时卡住。可以先把文本粘贴到记事本再复制过来。3)浏览器版本太低不支持 ES6 语法,需要 Chrome 80+ 或 Edge 80+。4)如果用了广告拦截插件,可能误拦截了页面脚本,关闭插件再试。

这个工具和 SEO 站长工具里的关键词密度工具有什么区别?

大部分 SEO 工具侧重爬取网页 URL 分析,需要联网且通常有每日查询次数限制。本工具纯浏览器端处理,不上传文本,适合分析自己本地的文章、文档或竞品文案的纯文本内容。另外,本工具额外提供了 TF-IDF 分值,而多数 SEO 密度工具只有词频和密度。缺点是只能处理纯文本,不能直接输入 URL 或 HTML。

我的文章里有很多重复的停用词(的、了、是),算密度时能不能过滤掉?

目前工具不会自动过滤停用词,所有词都会计入词频和密度。如果需要排除停用词,建议在粘贴前手动把文本中的停用词替换掉(比如把 '的' 替换成空格),或者用其他工具预处理。后续版本可能会加入停用词过滤开关。如果不处理,密度会被停用词拉低,真正关键词的密度会偏小。

隐私保证所有计算与处理均在你的浏览器本地完成,输入数据不会上传服务器,也不会保存或共享。

选择 打开 +新窗口 esc关闭