谷歌新作:AI 检测文件内容类型,5ms 即可完成 | 开源日报 No.192

google/magika

Stars: 5.0k License: Apache-2.0

magika 是一个利用深度学习来检测文件内容类型的工具。

  • 使用自定义、高度优化的 Keras 模型,仅约 1MB 大小,在单个 CPU 上能够在毫秒内实现精确的文件识别。
  • 在超过 1M 文件和 100 种内容类型(包括二进制和文本文件格式)的评估中,达到了 99% 以上的准确率和召回率。
  • 可作为 Python 命令行工具、Python API 和实验性 TFJS 版本使用,并支持批处理以加快推理速度。
  • 推理时间大约为每个文件 5ms,且独立于文件大小而保持近恒定。

karpathy/minbpe

Stars: 4.3k License: MIT

minbpe 是用于 LLM 分词中常用的字节对编码(BPE)算法的最小、干净代码。

  • 实现了基本 BPE 算法,直接在文本上运行。
  • 实现了 RegexTokenizer,通过正则表达式模式进一步拆分输入文本,在标记化之前将输入文本按类别(如:字母、数字、标点符号)进行分割。确保不会跨越类别边界进行合并。
  • 实现了 GPT4Tokenizer,是 RegexTokenizer 的轻量级包装器,完全复制了 tiktoken 库中 GPT-4 的标记化过程。

facebookresearch/DiT

Stars: 2.7k License: NOASSERTION

DiT 是 "Scalable Diffusion Models with Transformers" 的官方 PyTorch 实现。 该项目的主要功能、关键特性、核心优势:

  • 提供了基于 PyTorch 的 DiT 模型定义和预训练权重
  • 支持训练和采样代码
  • 分析了通过 Transformer 进行操作的潜在扩散模型(DiTs)的可扩展性
  • 在 ImageNet 512×512 和 256×256 基准测试中,DiT-XL/2 模型表现出色,取得最先进 FID 结果

ajeetdsouza/zoxide

Stars: 15.6k License: MIT

zoxide 是一个更智能的 cd 命令,支持所有主要的 shell。 主要功能是记住您经常使用的目录并快速跳转。

Stars: 6.1k License: MIT

chainlink 是一个去中心化预言机网络的节点,连接了链上和链下计算。

  • 扩展智能合约功能,实现对真实世界数据和链下计算的访问
  • 保持区块链技术固有的安全性和可靠性保证
  • 包含 Chainlink 核心节点和合约
  • 提供预构建 Docker 镜像以供下载使用
  • 活跃社区支持,并提供 Discord 作为主要沟通渠道
  • 提供详细文档指导、Solidity 开发资源等信息
相关推荐
MediaTea几秒前
人工智能通识课:深度学习
人工智能·深度学习
长风230几秒前
Day10:直面深水区——总结系统痛点与底层架构重塑
人工智能·安全
2601_94993696几秒前
2026电商运营个人能力提升计划进阶指南
大数据·人工智能
西安邮电大学2 分钟前
Kafka保证消息顺序性
java·后端·kafka
Surpass-HC3 分钟前
添加CLAUDE.md规则
人工智能
贺国亚6 分钟前
RAG 检索增强 · 向量库与 Chunking
后端·面试
Slow菜鸟6 分钟前
AI 代码知识图谱 教程(一)| Codegraph(纯代码)
人工智能·知识图谱
薛定猫AI6 分钟前
【深度解析】Claude Opus 4.8:高推理强度、Agentic Coding 与长任务工作流实战
人工智能
谁似人间西林客7 分钟前
告别“手搓”时代:工艺智能如何解放工程师双手
人工智能
凯丨8 分钟前
200 行 Python 训练一个 GPT:Karpathy 的极简主义 AI 教育实验
人工智能·python·gpt