服务器入门操作1(深度学习)

服务器相关

基本命令

查看GPU状态:

  • 查看GPU信息

  • 查看CPU信息

  • 查看系统版本号

    nvidia-smi
    lscpu
    lsb_release -a

清屏:

复制代码
clear

anaconda相关:

  • 查看环境列表

  • 激活虚拟环境

  • 退出虚拟环境

  • 跳转至目录

  • 跳转至上一级目录

    conda env list
    conda activate [环境名]
    conda deactivate [环境名]
    cd [路径]
    cd ..

进入虚拟环境后:

  • 查看虚拟环境中的package

  • 安装新的package

  • 执行python文件

    pip list
    pip install [package name]
    python [文件名].py

ctrl+c: 停止当前命令的执行

在命令行运行python:

  • 进入python环境:python
  • 退出环境:Ctrl+D / exit() (Linux环境)

后台运行

screen

【【Linux后台运行】服务器系列-Screen的使用教程】 https://www.bilibili.com/video/BV1De4y1F7C3/?share_source=copy_web&vd_source=3aa9ee0c4fcf2e52762a44f906c09534

Ubuntu安装:apt install screen

安装好以后:which screen 可以看到它的路径

功能:1 分屏 2 后台运行

常用参数和使用方法:

  • 将命令挂到后台运行:screen -dmS
    e.g. screen -dmS train_net1 bash -c "python train.py"
    前面的train_net1是给这个screen起的名字,双引号里面是真正要执行的命令。
  • 显示所有screen:screen -ls
  • 将后台的screen拉回前台,并查看实时输出:screen -r [screen的名称]
    e.g. screen -r train_net1
  • 重新将screen放回后台:Ctrl+A, 松开Ctrl和A以后按D键
  • 停止screen:
    • 先拉回前台,然后用正常方法关闭(Ctrl+C)
    • 强行停止:screen -XS [screen的名称] quit
    • 还是停不掉的话就用htop+任务管理器停止

创建快捷方式(可简化流程,不过由于是自己定义的,会有一定的独特性):vim ~/.bashrc 其中会引入~/.bash_aliases就是用户自己起的所有的别名

指定特定编号的GPU训练

通过环境变量指定:

在运行代码前,使用CUDA_VISIBLE_DEVICES环境变量直接限定可见的GPU:

复制代码
CUDA_VISIBLE_DEVICES=0,1 python train.py

CUDA_VISIBLE_DEVICES=2 python train.py

此环境变量会屏蔽其他的GPU,程序只能看到指定的GPU;全局生效,无需修改代码。

此方式亦可以结合screen使用:

创建screen:

复制代码
screen -dmS train_net1 bash -c "CUDA_VISIBLE_DEVICES=2 python train.py"

这样的话就可以使用编号为2的GPU进行训练啦!

如果程序里使用parser.add_argument()声明了GPU编号或者在json文件中声明了默认GPU编号,则可能出现上述方法不好用的情况。此时只需要根据程序内容,传入相关的GPU编号参数即可。

相关推荐
蒸蒸yyyyzwd2 分钟前
30天学习笔记day1
笔记
灵机一物2 分钟前
灵机一物AI智能电商小程序(已上线)-LangGraph落地电商购物Agent:搜索反馈回路从工程实践到产品化落地
人工智能·小程序
新新学长搞科研2 分钟前
【自动识别相关会议】第五届机器视觉、自动识别与检测国际学术会议(MVAID 2026)
人工智能·目标检测·计算机视觉·自动化·视觉检测·能源·语音识别
ShiMetaPi4 分钟前
Seeing the Unseen:基于事件相机的暗光重构特征提取方案
人工智能·计算机视觉·事件相机·evs
华农DrLai4 分钟前
什么是Prompt模板?为什么标准化的格式能提高稳定性?
数据库·人工智能·gpt·nlp·prompt
像风一样自由20205 分钟前
我把 draw.io MCP 接进 VS Code Codex,直接生成了带动画连接器的 LSTM 架构图
人工智能·lstm·draw.io
柯儿的天空6 分钟前
【OpenClaw 全面解析:从零到精通】第 009 篇:OpenClaw Skills技能系统与ClawHub技能市场全解析
人工智能·自然语言处理·ai作画·tensorflow
腾视科技TENSORTEC7 分钟前
安全驾驶 智在掌控|腾视科技ES06终端,为车辆运营赋能
大数据·人工智能·科技·安全·ai·车载系统·车载监控
SP八岐大兔9 分钟前
Ollama安装及运行模型
linux·服务器·ollama
晓晓不觉早9 分钟前
GPT-5.4 mini/nano 双炮登场:OpenAI 开启「模型编队」新时代
人工智能·gpt