tiktok-person-detection || tiktok-scene-detection


license: apache-2.0

language:

  • en
  • zh
    tags:
  • tiktok
  • person-detection
  • face-detection
  • body-detection
  • gguf
  • mlp
  • deep-learning
    metrics:
  • accuracy
    base_model: \[\]
    pipeline_tag: image-classification
    library_name: gguf

TikTok 视频人物检测模型

模型简介

基于深度MLP(多层感知器)的TikTok视频人物检测模型,能够检测视频中是否存在人物,以及人物的身体和脸部特征。

模型架构

复制代码
输入层: 12维手工特征
  ↓ 标准化 (X - mean) / std
隐藏层1: 2048神经元 (ReLU激活)
  ↓
隐藏层2: 1024神经元 (ReLU激活)
  ↓
隐藏层3: 512神经元 (ReLU激活)
  ↓
输出层: 4类 (Softmax)

模型规格

项目 数值
架构 Deep MLP 4层
参数量 2,651,652
模型大小 10.12 MB
模型格式 GGUF v3
输入特征 12维
输出类别 4类
准确率 100.00%
优化器 Adam
学习率 0.005
训练轮数 300 (提前停止)

人物类别

ID 类别 说明
0 no_person 无人
1 face_only 仅人脸
2 body_only 仅身体
3 face_and_body 人脸+身体

检测特征

模型通过分析以下特征来检测人物的身体和脸部:

脸部检测特征

  • 肤色像素比例 (YCbCr颜色空间)
  • 中心区域亮度 (脸部通常位于中心)

身体检测特征

  • 肤色区域分布范围
  • 整体图像亮度分布

辅助特征

  • 平均亮度、颜色饱和度、RGB通道均值
  • 边缘密度、对比度、纹理复杂度
  • 暖色调比例、垂直边缘比例

GGUF文件结构

模型包含10个张量:

  • W1 (12×2048), b1 (2048)
  • W2 (2048×1024), b2 (1024)
  • W3 (1024×512), b3 (512)
  • W4 (512×4), b4 (4)
  • X_mean (12) - 输入标准化均值
  • X_std (12) - 输入标准化标准差

使用方法

python 复制代码
import numpy as np
import struct
from PIL import Image

# 提取图像特征
def extract_features(image_path):
    img = Image.open(image_path).convert('RGB')
    img = img.resize((64, 64))
    arr = np.array(img, dtype=np.float32) / 255.0
    
    # 提取12维特征
    gray = 0.299 * arr[:,:,0] + 0.587 * arr[:,:,1] + 0.114 * arr[:,:,2]
    brightness = np.mean(gray)
    # ... 完整的特征提取
    
    return features

# 推理
features = extract_features("video_thumbnail.jpg")
features = (features - X_mean) / X_std
# 前向传播
z1 = features @ W1 + b1
a1 = np.maximum(0, z1)
z2 = a1 @ W2 + b2
a2 = np.maximum(0, z2)
z3 = a2 @ W3 + b3
a3 = np.maximum(0, z3)
z4 = a3 @ W4 + b4
pred = np.argmax(z4)
print(f"人物类别: {PERSON_CLASSES[pred]}")

训练数据

训练过程

Epoch Loss Accuracy
1 9.0784 32.06%
20 0.1293 98.61%
40 0.0006 100.00% (停止)

局限性

  1. 标签为启发式规则生成,非人工标注
  2. 肤色检测受光照条件影响
  3. 仅基于缩略图分析,未使用视频时序信息
  4. 无法识别多个人物或人物身份

License

Apache 2.0


license: apache-2.0

language:

  • en
  • zh
    tags:
  • tiktok
  • scene-detection
  • video-analysis
  • gguf
  • mlp
  • deep-learning
    metrics:
  • accuracy
    base_model: \[\]
    pipeline_tag: image-classification
    library_name: gguf

TikTok 视频场景检测模型

模型简介

基于深度MLP(多层感知器)的TikTok视频场景检测模型,能够对TikTok视频缩略图进行8类场景分类。

模型架构

复制代码
输入层: 12维手工特征
  ↓ 标准化 (X - mean) / std
隐藏层1: 2048神经元 (ReLU激活)
  ↓
隐藏层2: 1024神经元 (ReLU激活)
  ↓
隐藏层3: 512神经元 (ReLU激活)
  ↓
输出层: 8类 (Softmax)

模型规格

项目 数值
架构 Deep MLP 4层
参数量 2,653,704
模型大小 10.12 MB
模型格式 GGUF v3
输入特征 12维
输出类别 8类
准确率 99.79%
优化器 Adam
学习率 0.005
训练轮数 300 (提前停止)

场景类别

ID 类别 说明
0 indoor 室内场景
1 outdoor 室外场景
2 urban 城市场景
3 nature 自然场景
4 night 夜景
5 stage 舞台场景
6 sports 运动场景
7 restaurant 餐厅场景

输入特征 (12维)

特征 说明
0 平均亮度
1 颜色饱和度
2-4 RGB通道均值
5 边缘密度
6 中心区域亮度
7 肤色像素比例
8 对比度
9 纹理复杂度
10 暖色调比例
11 垂直边缘比例

GGUF文件结构

模型包含10个张量:

  • W1 (12×2048), b1 (2048)
  • W2 (2048×1024), b2 (1024)
  • W3 (1024×512), b3 (512)
  • W4 (512×8), b4 (8)
  • X_mean (12) - 输入标准化均值
  • X_std (12) - 输入标准化标准差

使用方法

python 复制代码
import numpy as np
import struct
from PIL import Image

# 加载GGUF模型
def load_gguf_model(gguf_path):
    with open(gguf_path, 'rb') as f:
        # 读取GGUF头部
        magic = struct.unpack('<I', f.read(4))[0]
        version = struct.unpack('<I', f.read(4))[0]
        n_tensors = struct.unpack('<Q', f.read(8))[0]
        # ... 解析元数据和张量
    return model

# 提取图像特征
def extract_features(image_path):
    img = Image.open(image_path).convert('RGB')
    img = img.resize((64, 64))
    arr = np.array(img, dtype=np.float32) / 255.0
    # 提取12维特征...
    return features

# 推理
features = extract_features("video_thumbnail.jpg")
features = (features - X_mean) / X_std
# 前向传播
z1 = features @ W1 + b1
a1 = np.maximum(0, z1)
z2 = a1 @ W2 + b2
a2 = np.maximum(0, z2)
z3 = a2 @ W3 + b3
a3 = np.maximum(0, z3)
z4 = a3 @ W4 + b4
pred = np.argmax(z4)
print(f"场景类别: {SCENE_CLASSES[pred]}")

训练数据

训练过程

Epoch Loss Accuracy
1 6.3942 60.99%
20 0.1787 98.15%
40 0.0852 99.79% (停止)

局限性

  1. 标签为启发式规则生成,非人工标注
  2. 仅基于缩略图分析,未使用视频时序信息
  3. 8类场景覆盖有限,未包含所有可能场景
  4. 仅适用于TikTok类短视频平台内容

License

Apache 2.0

相关推荐
H03111698511 分钟前
App竞品数据查询工具整理 月狐数据 蝉大师 点点数据功能概览
人工智能
叠层归一研究院43 分钟前
基于极限自指的叠层归一宇宙结构理论——无元外部封闭系统的内生区分模型
人工智能·经验分享·算法·agi
IT_陈寒1 小时前
Java线程池用错参数,我的服务居然悄悄崩溃了
前端·人工智能·后端
why-geo1 小时前
Hermes Agent 与 Python 的会产生什么样的碰撞
人工智能·python·ai编程
正经教主1 小时前
【FDE系列】阶段2:Day 29:FastAPI 进阶 — Pydantic 模型与完整 CRUD 实战
人工智能·python·fde
时速GEO系统1 小时前
初元 AI V1.1 版本升级,首个正式版发布一周・实现生成、部署、上线、优化全流程自动化闭环
人工智能·数据挖掘·node.js
咕泡科技1 小时前
咕泡科技FDE系列最新产品重磅发布!
人工智能·大模型·ai落地·fde·前沿部署工程师
犀利豆2 小时前
为什么全世界的 AI 都画不好一只骑自行车的鹈鹕
人工智能·llm·aigc
金色印象2 小时前
【论文解读】DRSN:把软阈值去噪“内化”进残差网络的强噪声故障诊断方法
深度学习·残差网络·故障诊断·软阈值·收缩函数·强噪声·drsn
天天被压力2 小时前
【跨市场数据实战 #08】可转债折价机会怎么筛:3个接口抓比价、列表和实时盘口
java·人工智能·python