火山引擎DataLeap:更强数据目录搜索能力,做到一步找数

更多技术交流、求职机会,欢迎关注字节跳动数据平台微信公众号,回复【1】进入官方交流群

随着数据管理变得更加复杂,元数据的重要性呈指数级增加。

如今,Data Catalog(数据目录)被看成是元数据管理的最佳工具,而一个通用的Data Catalog平台,通常包含元数据管理,搜索,血缘,标签,术语等功能。

其中,搜索是Data Catalog的入口功能,承担着让用户"找到数"的主要能力。

通过汇总和组织各种元数据,火山引擎大数据研发治理套件DataLeap的Data Catalog系统,可以帮助企业梳理数据、查询数据和理解数据的业务场景。而在DataLeap的Data Catalog系统中,每天有70%以上的用户会使用搜索功能。

区别于需要指定具体资产类型,或在搜索结果页对不同的资产分栏显示的联合搜索,为了满足个性化、多语言、秒级实时性等需求,火山引擎DataLeap的Data Catalog的系统采用了个性化综合搜索的方案。

该综合搜索方案允许用户在同一个搜索框中进行搜索输入,而无需指定搜索的资产类型;同时,搜索服务会在同一个搜索结果页返回不同类型的相关资产,并根据匹配程度和用户的个性化数据,进行混合排序。不仅可以给到不同用户针对不同资产的搜索需求,提供高度统一的搜索体验,同时还提供了跨类型圈定资产的能力。

图: 火山引擎DataLeap的Data Catalog系统整体架构

火山引擎DataLeap的Data Catalog搜索系统,采用了开源搜索引擎Elasticsearch。在海量数据下,其分布式的实时文件存储及实时分析搜索引擎,让每个字段都可以被索引且可用于搜索,可达到近实时秒级响应。同时,Elasticsearch采用的Restful api架构,天生的兼容多语言开发,且扩展能力强,可以处理PB级结构化或非结构化数据。

除了个性化的搜索需求,火山引擎DataLeap也支持单纯的列表模式,对于不要求精细度的查询需求,用户可以在此模式下,通过指定字段来对搜索结果进行简单排序。

未来,火山引擎DataLeap团队将进一步探索性能更完善的进阶搜索功能,包括查询语法功能的实现,以及血缘搜索和多租户之间模型的迁移。

除此之外,火山引擎DataLeap还可以提供数据集成、开发、运维、治理、资产等能力,帮助用户提升数据研发效率、降低管理成本,加速推动企业的数字化转型,目前已经应用于泛互联网、制造、新零售、汽车等领域,帮助数据团队有效的降低工作成本和数据维护成本、挖掘数据价值、为企业决策提供数据支撑。

点击跳转大数据研发治理套件 DataLeap了解更多

相关推荐
北邮刘老师17 分钟前
从SEO到ADO:智能体时代的流量密码
服务器·网络·数据库·人工智能·大模型·智能体·智能体互联网
javachen__20 分钟前
mysql系统级文件损坏修复
数据库·mysql
云和数据.ChenGuang20 分钟前
达梦数据库部署安装故障一
数据库·oracle·达梦·信创·达梦数据库
倔强的石头10632 分钟前
场景化落地指南——金仓时序数据库在关键行业的应用实践
数据库·时序数据库·kingbase
xj75730653332 分钟前
《精通Django》 第7章 高级视图和URL配置
数据库·django·sqlite
海棠AI实验室32 分钟前
第2篇:本地目录与资产标准(把“素材—文案—对话—上架”变成可追溯的生产线)
数据库·资产
数据知道36 分钟前
在PostgreSQL中并发保存上亿个图片链接和图片md5的对应关系,如何做最合适?
数据库·postgresql
麦麦鸡腿堡36 分钟前
MySQL_合计/统计函数
数据库·mysql
GIS之路39 分钟前
ArcGIS Pro 添加底图的方式
前端·数据库·python·arcgis·信息可视化
alonewolf_9942 分钟前
深入理解Redis线程模型:单线程神话与原子性实战
数据库·redis·缓存·分布式架构