放牧代码和思想
专注自然语言处理、机器学习算法

2016年09月的文章

序列标注模型算法比较
机器学习

序列标注模型算法比较

hankcs阅读(1370)评论(5)

偶然浏览到一篇挺有实际参考价值的论文Nguyen and Guo(2007)。该文比较了一些模型和算法在词性标注和OCR任务上的性能,包括HMM、CRF、AP、Structured SVM、M3N、SEARN算法以及SLE算法,对算法选型很...

基于结构化平均感知机的分词器Java实现
中文分词

基于结构化平均感知机的分词器Java实现

hankcs阅读(1497)评论(0)

最近高产似母猪,写了个基于AP的中文分词器,在Bakeoff-05的MSR语料上F值有96.11%。最重要的是,只训练了5个迭代;包含语料加载等IO操作在内,整个训练一共才花费23秒。应用裁剪算法去掉模型中80%的特征后,F值才下降不到0....

我的开源项目

HanLP自然语言处理包基于DoubleArrayTrie的Aho Corasick自动机