jason52
V2EX  ›  问与答

求扩展思路。曹政@caoz 的开发工程师招聘问题三:如何实现一个快速有效的,基于自定义词典精确匹配的分词系统?

  •  1
     
  •   jason52 · Aug 10, 2014 · 3245 views
    This topic created in 4293 days ago, the information mentioned may be changed or developed.
    一个典型问题,目前政府有屏蔽词表,每个网站都要遵守,发帖的时候会自动替换屏蔽词;另一个场景是诸如新浪新闻等媒体往往有商业词表,发新闻的时候会自动建立关键词铆接。这个相当于一个简单的基于词典的分词系统,下面的问题就是,如何实现一个快速有效的,基于自定义词典精确匹配的分词系统,一是要满足每天几万篇,几十万篇文章发布的要求;另一个必须的要求是,当词库倍增扩展时(比如10万词),效率的影响不允许是线性降低的。
    3 replies    2014-08-11 08:45:46 +08:00
    beordle
        1
    beordle  
       Aug 10, 2014 via Android
    用树呗
    beordle
        2
    beordle  
       Aug 10, 2014 via Android
    根本不需要分词啊
    n0rmrx
        3
    n0rmrx  
       Aug 11, 2014 via iPhone
    trie
    About   ·   Help   ·   Advertise   ·   Blog   ·   API   ·   FAQ   ·   Solana   ·   2949 Online   Highest 6679   ·     Select Language
    创意工作者们的社区
    World is powered by solitude
    VERSION: 3.9.8.5 · 29ms · UTC 15:17 · PVG 23:17 · LAX 08:17 · JFK 11:17
    ♥ Do have faith in what you're doing.