nlp中tokenizer用法

  • 1,将文本转换为标记

    • 将输入文本分解成一系列标记(tokens),这些标记可以是单词、子词、字符等。
    • 例如,句子 "Hello, world!" 可以被分解为 ["Hello", ",", "world", "!"]。
  • 2,为模型准备输入

    • 生成的标记可以进一步转换为模型需要的格式,如索引序列、张量等。
    • 例如,在词嵌入(word embeddings)模型中,标记可以映射到对应的嵌入向量。
    复制代码
      class ExampleTokenizer:
          def __init__(self, vocab):
              self.vocab = vocab
    
          def tokenize(self, text):
              # 简单的基于空格的分词器
              tokens = text.split()
              return tokens
    
      # 示例词汇表
      vocab = ["hello", "world", "this", "is", "a", "test"]
    
      # 创建分词器实例
      tokenizer = ExampleTokenizer(vocab)
    
      # 使用分词器进行分词
      text = "hello world this is a test"
      tokens = tokenizer.tokenize(text)
    
      print(tokens)  # 输出 ['hello', 'world', 'this', 'is', 'a', 'test']
相关推荐
da_vinci_x21 分钟前
Painter AI 材质 x 智能遮罩:告别“风格化”手K地狱
人工智能·aigc·材质·设计师·技术美术·工作流·游戏美术
盈飞无限23 分钟前
质量智能革命:SPC软件助力中国制造驶入高质量发展快车道
大数据·人工智能·制造
onebound_noah34 分钟前
从“识图”到“购得”:图片搜索商品如何重构消费与供应链逻辑?
人工智能·重构
AI_56781 小时前
AI开发革命:PyCharm科学计算模式重塑TensorFlow调试体验
人工智能·ai·neo4j
算家计算1 小时前
AGI为何被“判死刑”?李飞飞最新万字长文,指出一个致命缺失
人工智能·资讯
野豹商业评论1 小时前
三次更名的背后:百度AI的定位困惑
人工智能·百度
老蒋新思维1 小时前
2025 创客匠人全球创始人 IP + AI 万人高峰论坛:破局创业困境,拥抱无限未来
大数据·网络·人工智能·网络协议·tcp/ip·创客匠人·知识变现
永霖光电_UVLED1 小时前
EPC的GaN电源ic瞄准了机器人的敏捷性
人工智能·制造
Chef_Chen2 小时前
数据科学每日总结--Day13--数据挖掘
人工智能·数据挖掘
杰克逊的日记2 小时前
中型 GPU 服务集群监控方案(10-50 节点)
人工智能·gpu算力·gpu监控