编辑 | blame | 历史 | 原始文档

汉字、词语、成语的分析和处理程序

说明

本项目是用于汉字、词语、成语的分析和处理程序,包括汉字词频分析、汉字唯一性统计、汉字一二三级字表以及处理需要的各种字库、词语库、成语库等。

目录结构如下:

analyze: 用户分析,不生成新文件;
dict:各种字库,词库,成语库,有明确来源,不包括自己处理生成的库
process:各个批次的处理文件,按照日期/阶段/目标再创建二级目录
temp:临时文件

目标

用最少的四字形式(成语、组合以及拼凑),高效听读,最短时间掌握基础汉字。