码农场

放牧代码和思想
专注自然语言处理、机器学习算法
    愛しさ 優しさ 全て投げ出している

最新发布

HanLP 2.0 alpha版发布
自然语言处理

HanLP 2.0 alpha版发布

hankcs阅读(45)评论(3)

面向生产环境的多语种NLP工具包,基于 TensorFlow 2.0,目标是普及学术界最前沿的技术到工业界。HanLP具备功能完善、性能高效、架构清晰、语料时新、可自定义的特点。内部算法经过工业界和学术界考验,配套书籍《自然语言处理入门》已...

“原子”因果常识图谱
语料库

“原子”因果常识图谱

hankcs阅读(420)评论(0)

AAAI19的论文(Sap et al. (2019))开源了一个包含87万条推理常识的知识图谱ATOMIC。相较于常见的基于本体论分类条目的知识图谱,该知识库专注于“如果…那么…”关系的知识。作者提出了9种类型的因果联系来区分原因-效果、...

梯度下降与海森矩阵
机器学习

梯度下降与海森矩阵

hankcs阅读(1006)评论(1)

理一理基础优化理论,解释一下深度学习中的一阶梯度下降遇到的病态曲率(pathological curvature)问题。当海森矩阵condition number很大时,一阶梯度下降收敛很慢,无论是对鞍点还是局部极值点而言都不是个好事。 鞍...

定个小目标,发它一个亿条微博语料
语料库

定个小目标,发它一个亿条微博语料

hankcs阅读(1796)评论(13)

2019最新的微博语料,可用于预训练语言模型Weibo-BERT词向量等。由于比较时新,对网络流行语的建模可能很有帮助。每个压缩包都有两千多万条,一共5个。大家下载之后也算是有一个亿身家的人了,激动吧。感兴趣的同学要不要训练个Weibo-B...

依存句法分析在深度学习中的应用
自然语言处理

依存句法分析在深度学习中的应用

hankcs阅读(1631)评论(0)

句法分析是一项核心的NLP任务,目标是获取句子的主谓宾等句法结构。下级应用时,给定依存句法树,传统时代利用规则提取句法树的特征;在深度学习时代,如何提取树的向量表示?本文调研了7种常用模型,涵盖Tree RNN、DCNN和GCN等。 Tre...

语义依存分析SDP格式
语义分析

语义依存分析SDP格式

hankcs阅读(3669)评论(1)

本文是对SDP格式的官方文档的举例说明。对句子: More than a few CEOs say the red-carpet treatment tempts them to return to a heartland city for...

中文语义依存分析语料库
自然语言处理

中文语义依存分析语料库

hankcs阅读(5970)评论(3)

本文介绍语义依存的语言学知识以及BH中文语义依存语料库的标注规范。 给定一个句子,语义依存分析(Semantic Dependency Parsing,SDP)任务试图找出所有在语义上有所关联的词语对,并且预测相应的语义标签。在中文界,最有...

Wu Manber多模式匹配算法
算法

Wu Manber多模式匹配算法

hankcs阅读(12805)评论(2)

AC自动机中,转移的最小单位是一个字符。也就是说,匹配后只能移动一个字符,复杂度是线性的$O(n)$。然而线性并非最快,Boyer-Moore算法在匹配后可以跳过多个字符,比线性还快。据说在实践中,利用Boyer-Moore优化的AC自动机...

Structural Learning with Amortized Inference
机器学习

Structural Learning with Amortized Inference

hankcs阅读(3032)评论(0)

Chang et al. 2015提出加速结构化学习的近似算法AI-DCD,通过缓存整数线性规划中相似的问题及解,减少对ILP solver的调用次数,从而加速训练,同时不损失精度。 平摊推断 记$\mathbf{y}=\{y_1,y_2,...

我的作品

HanLP自然语言处理包《自然语言处理入门》