谷歌新作:AI 检测文件内容类型,5ms 即可完成 | 开源日报 No.192

google/magika

Stars: 5.0k License: Apache-2.0

magika 是一个利用深度学习来检测文件内容类型的工具。

  • 使用自定义、高度优化的 Keras 模型,仅约 1MB 大小,在单个 CPU 上能够在毫秒内实现精确的文件识别。
  • 在超过 1M 文件和 100 种内容类型(包括二进制和文本文件格式)的评估中,达到了 99% 以上的准确率和召回率。
  • 可作为 Python 命令行工具、Python API 和实验性 TFJS 版本使用,并支持批处理以加快推理速度。
  • 推理时间大约为每个文件 5ms,且独立于文件大小而保持近恒定。

karpathy/minbpe

Stars: 4.3k License: MIT

minbpe 是用于 LLM 分词中常用的字节对编码(BPE)算法的最小、干净代码。

  • 实现了基本 BPE 算法,直接在文本上运行。
  • 实现了 RegexTokenizer,通过正则表达式模式进一步拆分输入文本,在标记化之前将输入文本按类别(如:字母、数字、标点符号)进行分割。确保不会跨越类别边界进行合并。
  • 实现了 GPT4Tokenizer,是 RegexTokenizer 的轻量级包装器,完全复制了 tiktoken 库中 GPT-4 的标记化过程。

facebookresearch/DiT

Stars: 2.7k License: NOASSERTION

DiT 是 "Scalable Diffusion Models with Transformers" 的官方 PyTorch 实现。 该项目的主要功能、关键特性、核心优势:

  • 提供了基于 PyTorch 的 DiT 模型定义和预训练权重
  • 支持训练和采样代码
  • 分析了通过 Transformer 进行操作的潜在扩散模型(DiTs)的可扩展性
  • 在 ImageNet 512×512 和 256×256 基准测试中,DiT-XL/2 模型表现出色,取得最先进 FID 结果

ajeetdsouza/zoxide

Stars: 15.6k License: MIT

zoxide 是一个更智能的 cd 命令,支持所有主要的 shell。 主要功能是记住您经常使用的目录并快速跳转。

Stars: 6.1k License: MIT

chainlink 是一个去中心化预言机网络的节点,连接了链上和链下计算。

  • 扩展智能合约功能,实现对真实世界数据和链下计算的访问
  • 保持区块链技术固有的安全性和可靠性保证
  • 包含 Chainlink 核心节点和合约
  • 提供预构建 Docker 镜像以供下载使用
  • 活跃社区支持,并提供 Discord 作为主要沟通渠道
  • 提供详细文档指导、Solidity 开发资源等信息
相关推荐
古猫先生8 分钟前
YMTC Xtacking 4.0(Gen5)技术深度分析
服务器·人工智能·科技·云计算
骆晨学长26 分钟前
基于Springboot的助学金管理系统设计与实现
java·spring boot·后端
一水鉴天38 分钟前
智能工厂的软件设计 “程序program”表达式,即 接口模型的代理模式表达式
开发语言·人工智能·中间件·代理模式
蒙娜丽宁43 分钟前
深入理解Go语言中的接口定义与使用
开发语言·后端·golang·go
AskHarries1 小时前
java使用ByteBuffer进行多文件合并和拆分
java·后端
Hiweir ·1 小时前
机器翻译之创建Seq2Seq的编码器、解码器
人工智能·pytorch·python·rnn·深度学习·算法·lstm
Element_南笙1 小时前
数据结构_1、基本概念
数据结构·人工智能
FutureUniant1 小时前
GitHub每日最火火火项目(9.21)
人工智能·计算机视觉·ai·github·音视频
不染_是非1 小时前
Django学习实战篇六(适合略有基础的新手小白学习)(从0开发项目)
后端·python·学习·django
菜♕卷2 小时前
深度学习-03 Pytorch
人工智能·pytorch·深度学习