Python使用FastAPI结合Word2vec来向量化200维的语言向量数值

准备

bash 复制代码
pip install fastapi>=0.68.0
pip install uvicorn[standard]>=0.15.0
pip install gensim>=4.0.0
pip install jieba>=0.42.1
pip install numpy>=1.21.0
pip install scikit-learn>=1.0.0

少了的就直接补充就好

代码

python 复制代码
from fastapi import FastAPI, HTTPException
from gensim.models import KeyedVectors
import jieba
import numpy as np
import os
import logging

# 配置日志
logging.basicConfig(level=logging.INFO)

app = FastAPI(title="Text Embedding API")

# 路径配置
MODEL_PATH = os.path.abspath("../light_Tencent_AILab_ChineseEmbedding.bin")


# 服务启动前检查
@app.on_event("startup")
async def load_model():
    global model
    try:
        if not os.path.exists(MODEL_PATH):
            raise FileNotFoundError(f"Model file not found: {MODEL_PATH}")

        model = KeyedVectors.load_word2vec_format(MODEL_PATH, binary=True)
        logging.info(f"✅ 模型加载成功 | 词表量:{len(model.key_to_index)}")
        logging.info(f"✅ 词向量维度:{model.vector_size}")  # 确认输出200

    except Exception as e:
        logging.error(f"❌ 初始化失败:{str(e)}")
        raise RuntimeError("Service initialization failed")


def text_to_vector(text: str) -> np.ndarray:
    """直接返回200维向量"""
    words = jieba.lcut(text)
    vectors = []
    for word in words:
        if word in model.key_to_index:
            vec = model[word]
            # 添加维度验证
            assert vec.shape == (200,), f"词向量维度异常: {vec.shape}"
            vectors.append(vec)

    if not vectors:
        return np.zeros(model.vector_size)

    avg_vector = np.mean(vectors, axis=0)
    assert avg_vector.shape == (200,), f"平均向量维度异常: {avg_vector.shape}"
    return avg_vector


@app.get("/vector")
async def get_vector(sentence: str):
    if not model:
        raise HTTPException(503, "服务未就绪")

    if len(sentence.strip()) < 2:
        raise HTTPException(400, "输入文本过短")

    try:
        vector = text_to_vector(sentence)
        return {
            "dimension": vector.size,
            "vector": vector.tolist()
        }
    except Exception as e:
        logging.error(f"处理失败:{str(e)}")
        raise HTTPException(500, "内部错误")


if __name__ == "__main__":
    import uvicorn

    uvicorn.run(app, host="0.0.0.0", port=8000)
相关推荐
默_笙1 天前
🍙 给每个请求过安检:FastAPI 是怎么把校验写进类型注解的
python
小羊没烦恼!1 天前
初探性能优化——2个月到4小时的性能提升
java·开发语言·windows·算法·c#
qq_426003961 天前
启动playwright录制codegen生成自动化测试脚本
python·自动化
虎头金猫1 天前
4K 视频总卡在公网带宽?用 N1 + OpenList 把网盘播放链路重新理顺
运维·服务器·网络·python·容器·beautifulsoup·pandas
长沙三为智能科技1 天前
家政小程序开发从0到上线:五阶段交付流程与验收清单
python
伞伞悦读2 天前
【第38期】Python 模块与包详解:import、from、模块搜索路径、包结构和 __init__
开发语言·python
只睡四小时2 天前
Canvas 弹道联机实战:700 行 + 固定时间步长
python·websocket·html5·游戏开发·canvas
C语言小火车2 天前
C/C++ 为什么需要编译器?
开发语言·c++
奇思妙想聪明勤奋的小羊2 天前
DeepAgents第5章:子Agent 与上下文隔离—让 Agent学会委派
人工智能·python·学习·语言模型
lpfasd1232 天前
2026年第38周GitHub趋势周报
python·科技·github