Dalin L — 我造了一门支持中文编程的语言,完整移植到 Rust 了

从 Python 原型到 Rust 移植,从 HM 类型推断到模式匹配,2 小时全链路跑通。


1. 为什么造一门语言?

先回答一个绕不开的问题:为什么不直接用 Python/Rust?

答案是:为了验证设计。

Dalin L 的目标是一门面向 AI Agent 的编程语言。不是要替代现有语言,而是探索一种语义密度更高、对 LLM 更友好的表达方式。

我对这门语言有几个核心设计诉求:

  • 中文标识符全链路支持 --- 变量名、函数名、参数名全线中文化
  • HM 类型推断 --- 写 let x = 42 自动推断为 int,不写类型也能获得类型安全
  • 模式匹配 --- Some(v) => v, None => 0 一行顶 Python 四行 if isinstance
  • 管道操作 --- data |> filter |> map 数据流清晰可读
  • 零依赖运行 --- 纯 Rust 标准库,编译出来就一个二进制

在动手写 Rust 实现之前,我先把所有这些设计在 Python 里跑通了------词法分析、语法解析、HM 类型推断、树遍历解释器,250 个测试全覆盖。然后带着验证过的设计,一次性移植到 Rust。


2. 项目架构

整个语言分四层 Pipeline:

复制代码

每个模块职责清晰:

|--------------------|-------------------------------------------------------------------------------------|
| 模块 | 做什么 |
| Lexer | 把源码字符串拆成 Token 流。认识 28 个关键字、25+ 运算符、中文标识符、字符串转义、块注释、属性宏 #[derive] |
| Parser | 递归下降语法分析器(Pratt 运算符优先级)。支持 if/match/for/while/struct/enum/trait/impl 等 20+ 种语句结构 |
| TypeInferencer | Hindley-Milner 类型推断引擎。核心是 Robinson Unification 算法------解类型方程 α == int → {α → int} |
| Interpreter | 树遍历解释器。函数/闭包/递归、循环、模式匹配、结构体、管道操作、30+ 个内置函数 |


3. 最大亮点:HM 类型推断

原型阶段最核心的攻坚战是类型推断。HM(Hindley-Milner)是 ML 家族语言的类型系统------F#、OCaml、Haskell 都用它。

核心思想:类型变量 + 方程求解

当你写 let x = 42,推断器说"x 的类型是 α,但 α 必须等于 int",于是 α = int

当你写 fn id(x) { return x },推断器说"参数是 α,返回值也是同一个 α------所以 id 的类型是 α → α(多态)"。

然后在调用站实例化:

  • id(42)α 被实例化为 int → 返回值 int
  • id("hi")α 被实例化为 string → 返回值 string
  • id(true)α 被实例化为 bool → 返回值 bool

同一个函数,三种调用,三种不同的返回类型------编译器推断出来的,不用写一行类型注解。

这靠的是三个核心函数:

复制代码

然后在 CallExpr 的推断中用 _fresh_copy 为每次调用生成一组新鲜的类型变量,防止前一次调用的 substitution 污染后一次:

复制代码

不共享 seen dict 的结果是 id(42) 返回 α6 而不是 int------这个 bug 我修了半小时。


4. 中文编程:不只是换了个变量名

很多"中文编程"只是在 lexer 层把关键字翻译成中文。Dalin L 从头打到尾:

复制代码

所有层级原生支持 CJK 字符。不只是一个 token mapping,是从字符识别到运行时值查找的全链路。

复制代码

5. 模式匹配:五种模式 + 守卫 + 嵌套

模式匹配是 Dalin L 的亮点之一,支持:

复制代码

在 Python 原型里,五种模式都在 Pattern 这个 dataclass 里表示:

复制代码

Rust 移植后改用枚举表达,但在原型阶段 dataclass 的灵活性帮了大忙------改结构比改枚举容易得多。


6. Python 原型 → Rust 移植实录

Python 原型跑了 250 个测试全部通过后开始 Rust 移植。过程不复杂------架构已经验证过,直接翻译。

Python 原型规模:

  • 7 个文件,约 2500 行
  • 250 个测试(61 pytest + 85 端到端 + 104 手动边缘扫描)
  • HM 类型推断、模式匹配、中文支持全部验证通过

Rust 移植规模:

  • 7 个模块,约 2000 行
  • 42 个测试,42/42 通过
  • 零外部依赖

移植过程中遇到几个 Rust 特有的坑:

  1. Lexer 的 peek 语义 --- Python 版 _peek(offset=1) 默认看下一个字符,Rust 版我写了 peek(offset=0) 导致 == 被识别为 EQUAL 而非 DOUBLE_EQUAL。修了一个字。
  1. Parser 的 advance 返回值 --- Python 版返回 Token,Rust 版想返回 &Token 结果和 self.pos += 1 打架。改成返回 owned Token 解决。
  1. 递归函数的闭包问题 --- fn fact(n) { ... fact(n-1) ... } 在执行时,fact 这个函数值捕获的 closure 里没有 fact 自身(因为创建 FnValue 时还没定义好)。解决方案:在 Interpreter 上加一个 functions: HashMap<String, FnValue>,递归查找时先查函数表。
  1. env.child() 的 clone 陷阱 --- 当 env.child() 创建子作用域时,它 clone 了父 env。for 循环中用 assign 修改变量会修改 clone 而非原环境。修复方法是:直接在父 env 上操作(原型阶段简化了作用域隔离)。

7. 快速体验

复制代码

演示输出:

复制代码

语言 DEMO:

复制代码

8. 下一步

Dalin L 目前是经过验证的设计 + 可运行的 Rust 实现。当前处于 v0.1.0 阶段,后续方向:

  • Rc<RefCell<Environment>> 实现真正的词法作用域 --- 当前 if/for 的块作用域会泄漏变量到外层
  • 标准库 --- 最起码的文件读写、字符串操作
  • let-polymorphism 完善 --- 无注解递归函数的类型推导需要 fixpoint 或 let generalization
  • Web playground --- Wasm 版本在浏览器里跑

项目地址:github.com/CN-QN1-dalin/dalin-l

欢迎 star、issue、PR。如果你也在搞语言设计或 Agent-Native 的东西,直接提 issue 聊。

作者:QN1幻化引擎 贾大林 石家庄

相关推荐
冬奇Lab10 小时前
开源项目第178期:OptMem — 426 个 token 的提示词,给 AI Agent 跨会话的持久记忆
人工智能·开源·资讯
冬奇Lab11 小时前
代码库知识库系列(09):用 codebase-memory-mcp 实战——在 LightRAG 上跑三路召回
人工智能
科技圈观察11 小时前
选哪家服务商做跨境业务KYC数字身份认证和合规支持?2026出海选型参考
大数据·人工智能
oyguyteggytrrwwwrt11 小时前
自制交叉线路识别算法
算法
手写码匠11 小时前
华为云Flexus+DeepSeek征文|Dify 多智能体协同编排实战:R1 规划 + V3 执行,构建企业 Agent 团队
人工智能·深度学习·算法·aigc
舒一笑11 小时前
Windows + WSL2 完整复现 Avernet WAIC 6 Bot 协作演示
人工智能·git·开源
犀利豆12 小时前
我和 Claude Code 一起写了一本介绍 Claude Code 原理的书
人工智能·ai编程·claude
墨_浅-12 小时前
20260805金融科技动向:《知识产权保护和运用“十五五”规划》金融机遇
人工智能·科技·金融
微硬创新12 小时前
耐达讯自动化16路0-20mA转PROFINET协议转换模块技术说明
人工智能·网络协议·自动化·信息与通信