nlp news_classify

1、赛题理解

数据:文本数据,按照字符级别进行了匿名处理

标签:财经、彩票、房产、股票、家居、教育、科技、社会、时尚、时政、体育、星座、游戏、娱乐(14个类别) {'科技': 0, '股票': 1, '体育': 2, '娱乐': 3, '时政': 4, '社会': 5, '教育': 6, '财经': 7, '家居': 8, '游戏': 9, '房产': 10, '时尚': 11, '彩票': 12, '星座': 13}

评价指标:类别f1_score的均值

可能的解题思路: (1)TF-IDF + 机器学习分类器 (2)FastText (3)WordVec + 深度学习分类器 (4)Bert词向量