SEO标题字数取舍
运营小王在写一篇3000字的行业深度稿,标题栏只能放30个汉字。他需要判断「2025年AI芯片格局」和「国产AI芯片突围战」哪个词频策略更优。用本工具的TF-IDF功能对比两个标题,发现「AI」在全文出现47次但IDF值低,而「突围」虽只出现6次但IDF权重高,最终选后者让点击率提升22%。
| # | 关键词 | 次数▼ | 密度% | 占比 | TF-IDF |
|---|
写文章时,一个词出现几次才算「堆砌」?关键词密度工具不回答这个主观问题,它只做一件事:把一段文本拆成词,算出每个词出现的次数、占总词数的百分比,以及 TF-IDF 值——后者能过滤掉「的」「了」这类高频但无意义的词。所有计算在浏览器本地完成,文本不会被上传。适合写页面标题前快速检查核心词占比、或对比两版文案的用词集中度。
运营小王在写一篇3000字的行业深度稿,标题栏只能放30个汉字。他需要判断「2025年AI芯片格局」和「国产AI芯片突围战」哪个词频策略更优。用本工具的TF-IDF功能对比两个标题,发现「AI」在全文出现47次但IDF值低,而「突围」虽只出现6次但IDF权重高,最终选后者让点击率提升22%。
电商运营老李发现竞品A的详情页「抗菌」出现12次、「除螨」出现9次,怀疑对方在堆砌关键词。他把自己产品页的文案导入工具,计算词频分布,发现「抗菌」密度仅1.3%而竞品达4.7%,接近搜索引擎的堆砌阈值。据此调整自家文案,将核心词密度控制在2-3%的安全区间,避免了被降权风险。
研究生小陈写完5000字论文初稿,导师要求摘要突出「深度学习在医学影像分割中的应用」这个主题。他用工具扫描摘要,发现「分割」出现5次、「影像」出现3次,而「深度」只出现1次。按TF-IDF权重排序后,把摘要中「基于卷积神经网络的方法」改为「基于深度学习的影像分割方法」,使核心术语密度从0.8%提升至2.1%,更符合学术检索习惯。
法务专员小赵审核一篇保健品推文,发现「疗效」出现8次、「治愈」出现3次,但法规禁止医疗用语。用本工具统计全文词频,把「疗效」替换为「调理效果」、「治愈」替换为「改善」,同时用TF-IDF验证替换后「调理」的权重是否足够覆盖原意。最终文案通过审核,且点击率未下降。
1.把「词频」和「密度」混为一谈
「这个词出现了 5 次,密度就是 5」「词频 5 次,总词数 100,密度 = 5 / 100 × 100% = 5%」词频是原始出现次数,密度是相对比例。工具输出两个字段,把频次当密度会忽略文本长度对权重的影响。
2.分词粒度不一致导致 TF-IDF 失真
「关键词'数据分析',但工具按单字分词,把'数''据''分''析'当四个词算」「先确认工具分词模式:若支持短语匹配,输入'数据分析';若仅单字,应改为'数据 分析'并手动合并结果」TF-IDF 依赖分词粒度。单字分词会把复合词拆散,导致 IDF 分母虚高、TF 值偏低,最终权重偏离实际。
3.忽略停用词过滤对词频的影响
「'的'出现了 80 次,词频最高,所以关键词就是'的'」「先启用停用词过滤,把'的''了''在'等高频无意义词剔除,再分析剩余实词」中文停用词(如'的''是')占文本 30% 以上,不过滤会掩盖真正关键词。工具默认可能未开启过滤,需手动勾选。
4.用全角符号污染分词结果
「输入:'关键词,密度;测试。'(逗号、分号、句号全角)」「输入:'关键词,密度;测试.'(全部半角标点)」全角标点(,;。)在中文分词器中常被当作普通字符而非分隔符,导致粘连分词、词频统计偏大。
5.把 TF-IDF 当绝对重要性指标
「TF-IDF 值 0.8 的词一定比 0.6 的词更重要」「TF-IDF 值仅在同一文档集合内相对排序有效,不同集合的值不可跨文本比较」TF-IDF 是相对权重,依赖文档总数和词频分布。短文本的 TF 值天然偏高,长文本的 IDF 值更稳定,跨文本比较无意义。
6.输入包含 HTML 标签未预处理
「直接粘贴网页源码:<p>关键词密度</p>」「先提取纯文本:'关键词密度'」HTML 标签中的文本(如 <p>、<a>)会被当作正文内容统计,导致词频包含标签名(如 'p' 'a'),密度失真。
7.对同一文本重复计算密度
「同一篇文章复制粘贴 10 次,密度从 2% 变成 20%」「只粘贴一次原始文本」密度 = 词频 / 总词数。重复粘贴使总词数和词频同比例增加,密度不变,但用户误以为密度升高,混淆了频次和比例。
TF-IDF(t,d) = TF(t,d) × IDF(t)
TF(t,d)词 t 在文档 d 中的词频(出现次数/总词数)IDF(t)逆文档频率,log(总文档数/含 t 的文档数+1)文档 d 共 200 词,词“优化”出现 8 次,则 TF=8/200=0.04。语料库总文档 1000 篇,含“优化”的文档 50 篇,则 IDF=log(1000/(50+1))≈log(19.61)≈1.292。TF-IDF=0.04×1.292≈0.0517。
可以,中文、英文、中英混排都支持。分词按空格和标点自然切分,中文不会拆单字,而是按词间空格、换行或标点来识别。如果文本里中文词之间没加空格,工具会把整句当一个词处理,密度就会偏大。建议中文文本先用空格或换行把每个词分开,或者直接粘贴已分好词的文本,结果才准。
本工具是纯浏览器端处理,没有字数限制,但浏览器对超长文本的渲染和计算可能有卡顿。如果只显示部分结果,一般是浏览器内存或渲染限制。建议分段粘贴,每段 2000 字左右,或者把文本拆成多份分别分析。另外,工具不会截断,所有文本都会算,只是结果展示区可能滚动加载。
词频是每个词出现的绝对次数,适合快速看高频词。密度是词频占总词数的百分比,适合对比不同长度文本里的词重要性。TF-IDF 综合了词在文本中的频率和在整个语料库中的稀有度,适合从一堆文档里找出每篇的关键词。如果只分析一篇文章,密度比词频更有参考价值;如果分析多篇文章做对比,TF-IDF 更能挑出独特词。
密度算法有差异:分母是总词数还是总字符数,分词规则不同(比如英文缩写 'I'm' 算一个词还是两个词),标点是否计入分母。本工具分母为总词数(按空格和标点切分后的词个数),标点不计入词数。如果别家把标点当词算,密度就会偏低。建议始终用同一工具做对比,跨工具比密度意义不大。
TF-IDF 依赖你提供的语料库。如果只分析一篇文章,工具默认使用文章自身作为语料库,这时 IDF(逆文档频率)只能反映词在文章内部的稀有度。比如文章里只出现一次的生僻词,IDF 会很高,但实际可能不重要。要得到更合理的 TF-IDF,最好上传多篇文档作为语料库,本工具目前只支持单文本分析,单文本的 TF-IDF 仅供参考,建议结合词频和密度综合判断。
常见原因:1)文本太长导致浏览器卡死,等 10-15 秒没反应可以刷新重试,分短文本粘贴。2)粘贴的内容包含特殊字符或不可见控制符(如从 PDF 复制),工具分词时卡住。可以先把文本粘贴到记事本再复制过来。3)浏览器版本太低不支持 ES6 语法,需要 Chrome 80+ 或 Edge 80+。4)如果用了广告拦截插件,可能误拦截了页面脚本,关闭插件再试。
大部分 SEO 工具侧重爬取网页 URL 分析,需要联网且通常有每日查询次数限制。本工具纯浏览器端处理,不上传文本,适合分析自己本地的文章、文档或竞品文案的纯文本内容。另外,本工具额外提供了 TF-IDF 分值,而多数 SEO 密度工具只有词频和密度。缺点是只能处理纯文本,不能直接输入 URL 或 HTML。
目前工具不会自动过滤停用词,所有词都会计入词频和密度。如果需要排除停用词,建议在粘贴前手动把文本中的停用词替换掉(比如把 '的' 替换成空格),或者用其他工具预处理。后续版本可能会加入停用词过滤开关。如果不处理,密度会被停用词拉低,真正关键词的密度会偏小。
隐私保证所有计算与处理均在你的浏览器本地完成,输入数据不会上传服务器,也不会保存或共享。