-
1,将文本转换为标记:
- 将输入文本分解成一系列标记(tokens),这些标记可以是单词、子词、字符等。
- 例如,句子 "Hello, world!" 可以被分解为 "Hello", ",", "world", "!"。
-
2,为模型准备输入:
- 生成的标记可以进一步转换为模型需要的格式,如索引序列、张量等。
- 例如,在词嵌入(word embeddings)模型中,标记可以映射到对应的嵌入向量。
class ExampleTokenizer: def __init__(self, vocab): self.vocab = vocab def tokenize(self, text): # 简单的基于空格的分词器 tokens = text.split() return tokens # 示例词汇表 vocab = ["hello", "world", "this", "is", "a", "test"] # 创建分词器实例 tokenizer = ExampleTokenizer(vocab) # 使用分词器进行分词 text = "hello world this is a test" tokens = tokenizer.tokenize(text) print(tokens) # 输出 ['hello', 'world', 'this', 'is', 'a', 'test']
nlp中tokenizer用法
归一码字2024-07-10 15:15
相关推荐
大模型任我行1 小时前
谷歌:“课程学习”融入扩散模型强化学习AIGCmagic社区1 小时前
具身智能专题:机器人也有Scaling Law?智元GE-Act 2.0用3万小时真机数据给出答案Rosanci2 小时前
谷歌浏览器插件开发实战指南:从 Hello World 到上架发布明月_清风2 小时前
AI 越来越强,程序员真正的价值到底是什么?m0_466525292 小时前
云从科技上线云起ModelHub:AI团队时代的模型算力基础设施火山引擎开发者社区3 小时前
OpenViking:给 Codex 加上长期记忆荆棘鸟智能3 小时前
城市感知设备怎么统一接入?从多协议网关到设备模型的中间件架构设计火山引擎开发者社区3 小时前
当 AI 内容真假难辨,谁来为真实签名 —— 证书中心 C2PA 内容可信溯源服务正式发布百万蹄蹄向前冲3 小时前
风扇转了一晚上MVP专家团翻车事故米小虾3 小时前
你的 harness 技巧有保质期:176 组对照实验显示,上下文管理的收益从 35.7 分跌到 2.7 分