技术栈

tokenization

XLYcmy
2 小时前
自然语言处理·prompt·embedding·token·cot·tokenization·上下文工程
大语言模型(LLM)核心技术梳理:从词元化到 RAG 的工程实践Token(词元)是文本的基本单位。Tokenizer 的作用是把清洗后的文本字符串切分成有意义的基本单元序列,并构建词表(vocabulary)。例如句子 "I want a beer! Beer is cute!" 会被切分成 ["I", "want", "a", "beer", "!", "Beer", "is", "cute", "!"] 等 token,再映射为整数索引,形成训练数据。
格桑阿sir
4 个月前
ai·大模型·llm·agent·token·智能体·tokenization
04-大模型智能体开发工程师:Tokenization与模型推理流程系列文章导航:AI系列文章导航目录-持续更新中📝 本文摘要:本文详解Tokenization(BPE/WordPiece/Unigram三种主流方法)及其对模型"字数限制"、"数错字"和成本的实际影响,并逐步拆解从用户输入到模型输出的完整推理流程(Tokenization→特殊Token→Embedding→位置编码→Transformer层→采样→自回归→Detokenization),涵盖采样参数(Temperature/Top-p/Top-k)和KV Cache加速原理,附OpenAI API实战
IMdandelion
1 年前
wordpiece·tokenization·bbpe
子词分词器(Byte Pair Encoding + WordPiece)参考文章:子词分词器BPE和WordPiece理解_wordpeice-CSDN博客子词分词器BPE和WordPiece理解_wordpeice-CSDN博客
我是有底线的