技术栈
tokenization
XLYcmy
2 小时前
自然语言处理
·
prompt
·
embedding
·
token
·
cot
·
tokenization
·
上下文工程
大语言模型(LLM)核心技术梳理:从词元化到 RAG 的工程实践
Token(词元)是文本的基本单位。Tokenizer 的作用是把清洗后的文本字符串切分成有意义的基本单元序列,并构建词表(vocabulary)。例如句子 "I want a beer! Beer is cute!" 会被切分成 ["I", "want", "a", "beer", "!", "Beer", "is", "cute", "!"] 等 token,再映射为整数索引,形成训练数据。
格桑阿sir
4 个月前
ai
·
大模型
·
llm
·
agent
·
token
·
智能体
·
tokenization
04-大模型智能体开发工程师:Tokenization与模型推理流程
系列文章导航:AI系列文章导航目录-持续更新中📝 本文摘要:本文详解Tokenization(BPE/WordPiece/Unigram三种主流方法)及其对模型"字数限制"、"数错字"和成本的实际影响,并逐步拆解从用户输入到模型输出的完整推理流程(Tokenization→特殊Token→Embedding→位置编码→Transformer层→采样→自回归→Detokenization),涵盖采样参数(Temperature/Top-p/Top-k)和KV Cache加速原理,附OpenAI API实战
IMdandelion
1 年前
wordpiece
·
tokenization
·
bbpe
子词分词器(Byte Pair Encoding + WordPiece)
参考文章:子词分词器BPE和WordPiece理解_wordpeice-CSDN博客子词分词器BPE和WordPiece理解_wordpeice-CSDN博客
我是有底线的