跳转至

核心输入体系:万象拼音生态

万象拼音(Wanxiang)并不只是单一的 Rime 配置文件,而是一套围绕 Rime 引擎构建的拼音输入方案。

它从带声调词库、语法模型和输入方案配置出发,进一步整合双拼、辅助码、智能预测、多音字处理、反查和生僻字注音等功能,形成完整的拼音输入体系。


RIME-LMDG 语法模型

万象的长句预测和上下文排序能力,与万象生态中的开源项目 RIME-LMDG 密切相关。

RIME-LMDG 为 Rime 提供语法模型数据,用于参与连续输入时的候选组合与排序。

  • 语料基础:基于约 32GB 的多领域中文语料进行整理和训练,覆盖新闻、法律、文学、日常交流等内容。

  • 模型结构:采用多级 n-gram 语言模型,并结合词语与拼音信息进行统计。

  • 多音字处理:针对多音字、轻声和部分变调场景进行细化处理,使词语读音与实际使用场景保持更好的对应关系。

  • 字符覆盖:词库和模型数据覆盖 CJK 基本汉字及多个 Unicode 扩展区,可满足常用字与部分生僻字输入需求。

模型适配与命中率说明

RIME-LMDG 可以用于不同编码形式的 Rime 方案,但模型本身主要围绕拼音、声调和词语关系进行构建。

因此,不同输入方案使用同一模型时,实际效果会受到编码信息完整程度的影响。通常情况下,带声调拼音能够提供更充分的读音信息;无调拼音、形码或其他编码方案也可以使用,但模型参与排序时能够利用的信息有所不同。


标准版与增强版

万象主仓库 rime-wanxiang 提供 Base 与 Pro 两套主要方案。两者共享基础词库和部分功能,但在辅助码和编码结构上有所区别。

对比维度 万象标准版 (Base) 万象增强版 (Pro)
核心定位 面向常规拼音输入,配置相对简单 在拼音基础上进一步加入辅助码筛选
适合人群 全拼 / 双拼用户,以及刚开始使用 Rime 的用户 双拼与辅助码用户,希望进一步缩小同音候选范围
核心编码 声调全拼 声调全拼 + 独立辅助码
双拼支持 支持多种双拼方案挂接 内置多种常用双拼方案,可通过配置或指令切换
辅码支持 提供反查和直接辅助滤镜(不同于PRO) 内置多种辅助码体系,可根据个人习惯选择
特色反查 支持单字状态下使用反引号引导反查,并支持部件、笔画等方式 与 Base 保持一致
生僻字注音 开启后,可在输入区与候选中显示带声调拼音 与 Base 保持一致

如果主要使用全拼或双拼,并不需要辅助码筛选,可以优先选择 Base;已经熟悉辅助码,或希望进一步提高同音候选筛选效率,则更适合使用 Pro。


项目定位与使用边界

万象主要关注词库、模型、输入方案和相关 Lua 功能的维护,并不会覆盖所有 Rime 基础知识和编码体系的教学。

关于学习成本

  1. 不提供双拼或形码基础教学:例如小鹤双拼键位、五笔字根等内容属于具体编码方案本身,需要根据所选输入方式单独学习。

  2. 不替代 Rime 基础教程:如果需要深入修改 YAML、Patch、Translator、Filter 等配置,仍需要了解 Rime 的基本配置结构。

  3. 建议先完成基础使用,再逐步扩展:首次使用时可以先保持默认配置,确认输入、部署和方案切换正常后,再根据需要增加双拼、辅助码、模糊音或其他自定义内容。

万象的维护重点主要集中在词库质量、语法模型、输入逻辑和方案兼容性。基础数据越稳定,后续的个性化配置也越容易建立在可控的输入结果之上。


参与共建

万象和 RIME-LMDG 都以开源方式维护。如果在使用过程中发现词条、读音、模型表现或配置问题,可以通过项目仓库提交反馈或参与改进。

如果项目对你有帮助,也可以在 GitHub 上为相关仓库添加 Star,用于关注后续更新。

词库、模型与输入方案共同决定最终的候选质量,万象的核心工作也围绕这三部分持续展开。