| process/README.md | ●●●●● 补丁 | 查看 | 原始文档 | blame | 历史 |
process/README.md
@@ -1,8 +1,21 @@ # 各种预处理脚本 # 阶段性的处理过程脚本和数据 ## 说明 final-stage-one-4000 : 之前已经形成定稿的 4000个不重复汉字,编成了1000个四字(成语、词语) new-stage-two : 目前正在进行中的。 1、 以文件中的 两个千高词频.docx 为准,凑成四字(成语),覆盖这2000个汉字; 2、 按照字频顺序+一二三级字顺序,综合排列出所有成语和词语的顺序; 3、 按照先选择高频字的优先级,选出的四字组合;---正在做 4、 再叠加其他四字成语库;---未做 5、 再叠加2字词语库; ---未做 ## 目标