-
1,将文本转换为标记:
- 将输入文本分解成一系列标记(tokens),这些标记可以是单词、子词、字符等。
- 例如,句子 "Hello, world!" 可以被分解为 "Hello", ",", "world", "!"。
-
2,为模型准备输入:
- 生成的标记可以进一步转换为模型需要的格式,如索引序列、张量等。
- 例如,在词嵌入(word embeddings)模型中,标记可以映射到对应的嵌入向量。
class ExampleTokenizer: def __init__(self, vocab): self.vocab = vocab def tokenize(self, text): # 简单的基于空格的分词器 tokens = text.split() return tokens # 示例词汇表 vocab = ["hello", "world", "this", "is", "a", "test"] # 创建分词器实例 tokenizer = ExampleTokenizer(vocab) # 使用分词器进行分词 text = "hello world this is a test" tokens = tokenizer.tokenize(text) print(tokens) # 输出 ['hello', 'world', 'this', 'is', 'a', 'test']
nlp中tokenizer用法
归一码字2024-07-10 15:15
相关推荐
熊野君12 小时前
附录与 Codex 实操手册Zaimmm12 小时前
AI医学研究工具助力肝癌术后急性脑梗早期护理实践研究|证元芳 2026木卫四科技12 小时前
AgentAntibody:Prompt 注入防御开始“长记忆”,LLM Agent 如何构建自进化免疫系统?Djvu67712 小时前
让 Codex / Claude Code / Hermes 共享同一个搜索+抓取工具:一份 SKILL.md 走天下的取舍chunmiao303212 小时前
OpenAI 官宣断供 Cursor,AI 编程迎来第一次模型断供pnoker12 小时前
IoT DC3 AI 能力:Agentic Center 的设计与边界147API12 小时前
评测分数不理想,什么时候值得补蒸馏数据不会写代码的女程序猿12 小时前
养生馆采购 AI 四诊仪,5000 元预算怎么选?天天代码码天天13 小时前
一个 HTML 就能跑完整 OCR:lw.PPOCR.C 发布 v0.1.0-preview.4,新增浏览器 JavaScript SDKAI情绪识别开源13 小时前
检信 AI 智能推广平台(代号:JX-Promote)