1. 英语词库 (English Datasets)

A. 开发者首选 (最全单词列表)

  • dwyl/english-words (GitHub)
    • 简介: GitHub 上最流行的英语单词列表,包含约 47.9 万个单词。来源于 Unix 系统自带的字典文件。
    • 格式: .txt (纯文本,一行一个词), .json
    • 适用: 拼写检查、自动补全、密码字典。
    • 地址: GitHub - dwyl/english-words

B. 语义与关系数据库 (含释义)

  • Princeton WordNet
    • 简介: 普林斯顿大学开发的经典英语词汇数据库,它不仅收录单词,还构建了单词之间的语义关系(同义词、上下位词等)。
    • 格式: 数据库文件, API
    • 适用: 自然语言处理 (NLP)、AI 开发、高级词典应用。
    • 地址: Princeton WordNet Download

C. 学习与分级词表 (CEFR/考试)

  • Oxford 3000™ / 5000™
    • 简介: 牛津核心词汇表,按 CEFR(A1-C1)分级。虽然官方主要提供 PDF,但 GitHub 上有许多开发者整理好的 CSV/JSON 版本。
    • 适用: 语言学习应用、背单词软件。
    • 地址: 搜索 “Oxford 3000 5000 text list github” 或访问 Oxford Learner’s Dictionaries
  • COCA (Corpus of Contemporary American English)
    • 简介: 当代美语语料库,提供基于频率的单词列表(前 5000/20000 高频词)。完整版需购买,但有部分免费样本数据。
    • 地址: English-Corpora.org

2. 中文词库 (Chinese Datasets)

A. 综合词频库

  • THUOCL (清华大学开放中文词库)
    • 简介: 由清华大学自然语言处理实验室提供,包含 IT、财经、法律、医学等多个领域的词频统计。
    • 格式: .txt
    • 适用: 中文分词、输入法优化、特定领域词汇提取。
    • 地址: THUOCL 官网

B. 汉英词典数据

  • CC-CEDICT
    • 简介: 最著名的开源汉英词典项目,几乎所有开源中文词典 App (如 Pleco 的免费部分) 都基于此数据。
    • 格式: .u8 (文本格式,易于解析)
    • 内容: 包含繁简字体、拼音、英文释义。
    • 地址: MDBG CC-CEDICT Download

C. 汉字与HSK等级

3. 多语言与结构化数据 (Multilingual)

  • Kaikki.org (Wiktionary 提取版)
    • 简介: 这是一个极其宝贵的资源。它将维基词典 (Wiktionary) 的非结构化数据提取为机器可读的 JSON 格式。
    • 包含: 几乎所有语言的单词、发音 (IPA)、词性、释义、例句。
    • 适用: 需要极其详细数据的复杂应用开发。
    • 地址: Kaikki.org

建议

如果您是作为开发者寻找数据:

  • 轻量级:直接去 GitHub 搜 english-wordschinese-wordlist
  • 重量级:使用 Kaikki.org 的 JSON 数据或 WordNet

如果您是学习者寻找资料:

  • 建议搜索 “CEFR word list PDF” 或 “HSK vocabulary list Excel” 直接获取打印版或表格版。

开源英语词库与字典数据库大全

本指南整理了目前主流且质量较高的开源/免费英语词库与字典数据库,涵盖英汉双语、纯英文单词列表、自然语言处理(NLP)语义网络等多种类型,方便开发者和研究人员一键复制、收藏与集成。


一、 英汉双语词库(最适合:英语学习App、翻译工具)

1. ECDICT (Free English to Chinese Dictionary Database)

  • 项目简介:GitHub 上极其著名的开源英汉词库,包含了约 340 万条词条记录,数据结构化程度极高。
  • 核心内容:单词、音标(英/美)、词性、中文释义、柯林斯星级、牛津核心词汇标记、词频、BNC词频、EE/CE等。
  • 支持格式.csv, .sqlite, .json
  • 适用场景:背单词App、划词翻译、本地词典、词频分析。
  • 开源地址https://github.com/skywind3000/ECDICT

2. Kaiki / Wiktionary Parser

  • 项目简介:维基词典(Wiktionary)拥有海量的多语言数据,但原始数据杂乱。社区有许多开源解析器将其转化为结构化的双语/多语词典。
  • 核心内容:多语言释义、词源、例句、派生词。
  • 支持格式:JSON, XML
  • 适用场景:多语言翻译、重度词典应用。
  • 推荐方式:在 GitHub 搜索 wiktionary-to-jsonkaiki

二、 纯英文单词列表(最适合:拼写检查、自动补全、文字游戏)

1. dwyl/english-words

  • 项目简介:一个极其轻量且纯粹的英文单词列表,包含了大约 46.6 万个合法的英文单词。
  • 核心内容:仅包含纯文本单词列表,没有任何释义。
  • 支持格式:纯文本 (.txt), .json
  • 适用场景:输入法自动补全、合法单词校验、文字游戏(如 Wordle 变体)、密码字典。
  • 开源地址https://github.com/dwyl/english-words

2. SCOWL (Spell Checker Oriented Word Lists)

  • 项目简介:专门为现代拼写检查器(如 GNU Aspell、Hunspell)设计的权威词汇库。Linux、Office 等软件的拼写检查多基于此。
  • 核心内容:根据单词的常见程度(词频分级)、美式/英式/加拿大式英语变体进行了严格归类。
  • 支持格式:文本列表、补全规则文件
  • 适用场景:文本编辑器的拼写检查(Spell Checker)、语法纠错。
  • 官方网址http://wordlist.aspell.net/

三、 高阶语义网络与英英词典(最适合:AI、NLP、知识图谱)

1. WordNet (普林斯顿大学)

  • 项目简介:自然语言处理(NLP)领域殿堂级的英语词汇数据库。它不仅仅是字典,更是一个认知语义网络
  • 核心内容:将名词、动词、形容词和副词组织成同义词集(Synsets),并定义了丰富的语义关系,如:
    • 上位词 (Hypernyms):如 “狗” 的上位词是 “哺乳动物”
    • 下位词 (Hyponyms)
    • 部分/整体关系 (Meronyms/Holonyms)
  • 支持格式:内置于 Python NLTK 库,提供原始数据库文件。
  • 适用场景:语义分析、文本相似度计算、知识图谱构建、AI 机器阅读。
  • 官方网址https://wordnet.princeton.edu/

2. GCIDE (GNU Collaborative International Dictionary of English)

  • 项目简介:基于 1913 年版的《韦氏大词典》(已进入公有领域)并由开源社区合作维护和扩展的现代英英词典。
  • 核心内容:极其详尽的英文定义、出处、古英语/现代英语演变、例句。
  • 支持格式:XML, 纯文本
  • 适用场景:开发重量级的离线英英词典、历史语言学研究。
  • 官方网址http://gcide.gnu.org.ua/

四、 特定场景与行业词库(最适合:垂直领域、应试教育)

1. Moby Project

  • 项目简介:互联网历史上最大的公有领域(Public Domain)词汇资源集合之一。
  • 核心内容:包含 25 万词条的同义词库(Moby Thesaurus)、发音库(Moby Pronunciator)、连字符库等。
  • 适用场景:写作辅助、同义词替换、语言学实验。

2. 国内应试英语词库(高考/四六级/考研/GRE)

  • 项目简介:由国内开源社区和开发者自发整理的各大考试大纲词汇,通常结构化良好。
  • 核心内容:单词、考频、核心中文翻译、部分带记忆口诀。
  • 获取方式:在 GitHub 搜索关键字如 CET4-jsonkaoyan-wordsGRE-word-list 即可直接克隆。

💡 开发者选型建议

  • 场景 A(国内查词/背单词应用)ECDICT 是绝对的首选,离线数据开箱即用,中文释义准确。
  • 场景 B(拼写校验/密码学/补全):用 dwyl/english-words,体积小、加载快、过滤低频冷僻词。
  • 场景 C(聊天机器人/AI文本挖掘/语义知识库):请直接调用 WordNet(推荐配合 Python nltk 库使用)。