将输入文本切分为 1~6 个词的连续片段(n-gram),统计每种组合的出现次数。支持有序(相邻词根按顺序)和无序(任意顺序组合)两种模式。
示例:stainless steel water bottle 的 2-gram 有序结果为 stainless steel、steel water、water bottle。
PMI(Pointwise Mutual Information)衡量两个词的搭配是否"真实固定",而非单纯因为各自高频而碰巧相邻。
PMI ≥ 3 为强搭配(如 stainless steel 在含多种材质的文本中);PMI < 0 表示互斥,两个词倾向于互相回避。
公式:PMI = log₂( P(AB) / (P(A) × P(B)) )
基于 Amazon 索引规则,自动从分析结果中提取不重复词根,按覆盖率贪心打包进 250 字节限制内。每个词根在最终串中只出现一次,避免浪费字节空间。
字段校验会同步估算去重后实际可容纳的词根数量。