标签分类调研

  1. 任务

本周任务:

(1)合并两个版本代码,发布一个新网址供比较

(2)调研分类标签的方法

  1. 修改代码

代码已修改好,将文件压缩后通过WinSCP转移到服务器上,需要重新配环境。

步骤:

在Linux系统中,虚拟环境的激活脚本位于bin目录下,而不是Scripts目录(windows)。

所以先删除原本环境:

复制代码
rm -rf .venv

下载一个没有pip的虚拟环境,不然会下载失败,而且没有sudo权限,无法安装python3-10-venv

复制代码
# 创建不带pip的虚拟环境
python3 -m venv --without-pip venv

# 激活虚拟环境(即使没有pip,基本环境还是可用的)
source venv/bin/activate

# 下载get-pip.py
# curl https://bootstrap.pypa.io/get-pip.py -o get-pip.py
# curl不可用,使用wget
wget https://bootstrap.pypa.io/get-pip.py

# 在虚拟环境中安装 pip
python get-pip.py

然后安装需要的包

由于和python3.10版本兼容问题,需要把requirements.txt的

torch=1.11.0

scikit-learn==1.0.2

复制代码
# 进入项目目录
cd "Mind-Dharma Q&A System"

# 安装requirements.txt中的所有包
pip install -r requirements.txt

会出现 tokenizers 包因为需要 Rust 编译器而失败。

而且之前下载的没有被记录下来,所有现在一个一个安装,不要使用requirements.txt来安装

复制代码
# 安装 jieba
pip install jieba==0.42.1

# 安装 numpy
pip install numpy==1.21.2

# 安装 pandas
pip install pandas==1.3.3

# 安装 scikit-learn
pip install scikit-learn==1.0.2

# 安装 torch
pip install torch==1.11.0

# 安装 gunicorn(如果已经安装会跳过)
pip install gunicorn==20.1.0

运行程序

复制代码
python xinfa_QA.py
  1. 标签分类

做法:如果采用BGE模型,生成向量后,进行相似度计算,一级标签可以通过相似度最高的语句,生成和它一样的标签,二级标签可以通过返回top-k个答案的标签放回。

但是这样的缺点就是:

  • 如果数据集中没有与新问题相似的问题,那么预测可能不准确。

  • 如果数据集中存在错误标签,也会影响预测结果。

关于HiTIN:

相关推荐
qq_284274058 小时前
机械原理笔记:平面机构自由度计算(复合铰链、局部自由度、虚约束)与四杆机构入门(含考点)
笔记·学习·平面·自动化·制造
qq_284274059 小时前
数控铣床与加工中心笔记:铣刀与刀柄系统、G54试切对刀、镜像加工指令、孔加工工艺(钻扩铰镗)与固定循环G73/G83/G81/G76/G87/G84
笔记·学习·自动化·制造
Titan202410 小时前
MySQL访问个人学习笔记
笔记·学习·mysql
深圳老胡11 小时前
STM32CubeMX 生成 CMake 工程,用 VSCode 编译与调试的完整流程
笔记·stm32·单片机·代码规范
坤坤子吖12 小时前
C++智能指针:RAII、shared_ptr与内存泄漏
开发语言·c++·笔记·学习
乐橙开放平台12 小时前
智慧连锁客流检测和离岗检测怎么对接
大数据·人工智能·笔记·物联网·自动化·音视频·智能家居
零基础12312 小时前
FinalShell 使用教程:从安装到高效运维
运维·经验分享·笔记·finalshell
ACP广源盛1392462567312 小时前
Type‑C 扩展坞方案选型笔记|国产 DP1.4 转 HDMI2.0 桥接芯片 GSV2201S @ACP评估
c语言·开发语言·笔记·硬件架构·硬件工程·国产芯片
敲个大西瓜14 小时前
langchain笔记(一)
redis·笔记·langchain
带金箍的至尊宝14 小时前
系统架构设计师笔记 05:第2章硬件与软件基础,冯诺依曼结构怎么考
数据库·笔记·系统架构