Datawhale Easy Data × AI:笔记1 已重做,看新的笔记

Task 1 · 环境准备与课前导读 · 打卡笔记

JSON 原始结果

python 复制代码
{
  "shell": { "powershell": "5.1.19041", "bash": "GNU bash 5.1.16" },
  "python": { "version": "3.12.4", "executable": ".venv\\Scripts\\python.exe" },
  "python_venv": { "exists": true, "version": "Python 3.12.4" },
  "pip_check": { "ok": true, "output": "No broken requirements found." },
  "conda": "conda 24.11.3",
  "git": { "version": "git version 2.53.0.windows.2", "user.name": "jackiebox" },
  "git_repo": {
    "ok": true,
    "last_commit": "66ecb86 docs: 更新 sidebar 链接",
    "remote": "https://gitee.com/zouzhi/easy-data-x-ai.git"
  },
  "ssh_key": ["id_ed25519.pub"],
  "network": { "github.com": true, "gitee.com": true, "api.deepseek.com": true },
  "api": { "key_len": 35, "base_url": "https://api.deepseek.com/v1", "ok": true },
  "d1_1": {
    "ok": true,
    "output": "RAG(检索增强生成)是一种让大模型先从外部知识库检索相关信息,再基于这些信息生成回答的技术..."
  }
}

🔧 环境搭建要点(Windows 用户参考)

  1. 代码仓库拉取

GitHub 在部分网络环境可能超时,我直接用 Gitee 镜像:

bash 复制代码
git clone --depth 1 https://gitee.com/zouzhi/easy-data-x-ai.git
  1. Python 虚拟环境 + 清华镜像
bash 复制代码
cd easy-data-x-ai
python -m venv .venv
.\.venv\Scripts\python.exe -m pip install --upgrade pip -i https://pypi.tuna.tsinghua.edu.cn/simple
.\.venv\Scripts\python.exe -m pip install -r code/requirements.txt -i https://pypi.tuna.tsinghua.edu.cn/simple
.\.venv\Scripts\python.exe -m pip check
  1. 模型 API 配置(DeepSeek)

课程默认走 SiliconFlow / DashScope,我用的是 DeepSeek(OpenAI 兼容),做了两件事:

(a) 升级 `code/config.py` 为自动 fallback 体系

python 复制代码
# 优先探测顺序:DeepSeek → SiliconFlow → DashScope → OpenAI
# 未配置的自动回退到下一个可用 provider
from config import Config
llm = init_chat_model(
    Config.get_model("tencent/Hunyuan-MT-7B"),   # SiliconFlow 别名自动映射为 deepseek-chat
    model_provider="openai",
    **Config.get_llm_init_kwargs(),
)

(b) 写 `code/.env` + Windows 用户环境变量双保险

python 复制代码
DEEPSEEK_API_KEY=sk-xxxxxxxxxxxxxxxxxxxxxxxxxxxxxxxx
DEEPSEEK_BASE_URL=https://api.deepseek.com/v1

📚 课前导读学习笔记

1 · 大模型的本质与边界

核心观点 :大模型不是"会思考的机器",而是一个条件概率生成器------基于训练数据中的统计关联,预测"下一个最可能的 token"。

三个核心边界经常被忽略:

  1. 幻觉(Hallucination)* :模型不知道自己"不知道什么",纯靠概率分布生成,没有事实校验机制

  2. 上下文窗口限制 :单次对话能"看到"的 token 有限(deepseek-chat 约 128K),超出就遗忘

  3. 训练数据的静态性:知识停在训练截止日期之后,对新事件一无所知

和我之前的认知差异:以前以为 RAG 只是"给模型喂资料",现在理解它是主动弥补边界缺陷的手段------把"静态知识"转成"动态检索",在推理时注入最新事实。

2 · AI Agent 全景图

核心观点:Agent ≠ 更强的 ChatGPT,而是一个"感知 → 推理 → 行动 → 观察"的循环系统。

用户提问 → 模型推理(要不要用工具?)→ 调用工具(搜知识库/查数据库)

→ 观察工具结果 → 再次推理 → 最终回答(或继续行动)

相关推荐
要开心吖ZSH2 小时前
MySQL 慢 SQL 排查操作手册-个人笔记版
java·笔记·sql·mysql·慢查询
咖啡忍者3 小时前
【SAP】程制造生产计划PP-PI(Production Planning for Process Industries)
笔记
Titan20244 小时前
MySQL索引学习笔记
笔记·学习·mysql
zhangrelay4 小时前
Arduino-MEGA-ESP单片机理论课笔记02-硬件-2026
笔记·单片机·嵌入式硬件
AOI小白新手上路5 小时前
VDMamba·AutoDL 复现笔记 · 学习笔记
笔记·学习
ACP广源盛139246256736 小时前
USB3.0 高速信号切换方案评估,LH3412 @ACP双通道差分开关硬件选型笔记
笔记·硬件架构·硬件工程·国产芯片·开关
自不量力的A同学6 小时前
Goldfish Scheme v18.11.39 发布了:迈向现代宏系统与多核并发
笔记
海里的果7 小时前
论文阅读笔记-<Alpamayo-R1 >
论文阅读·笔记
浅念-8 小时前
动态规划专题:斐波那契数列模型 + 网格路径DP(LeetCode例题全解析)
笔记·算法·leetcode·面试·职场和发展·动态规划·推荐算法