Graph2NLP浅谈

图技术

利用neo4j、networkx、dgl、python做图分析挖掘

【1】最短路径算法dijkstra
【2】基于networkx的隐性集团关系识别模型
【3】基于Neo4j的担保社群型态分析挖掘
【4】基于python求有向无环图中target到其他节点全路径
【5】有向图中任意两点的路径
【6】图基础入门
【7】知识图谱快速入门
【8】基于graphsage的欺诈用户风险识别


Graph2NLP浅谈

前言

主要是把图数据 转化为文本 的实践和尝试,后续应用于实际的业务场景中。图数据来源于基于graphsage的欺诈用户风险识别 中的graph.bin ,自然语言处理手段主要来源于基于word2vec的word相似度 中的word2vec


一、构图

使用一个小图,举例说明如何进行转换,下图包含6个节点与6条关系。
企业0 企业1 企业2 企业3 企业4 企业5

利用dgl进行构图,代码如下。

python 复制代码
import dgl
import torch
import numpy as np
import numpy
import os
from dgl.data import DGLDataset, save_graphs, load_graphs
graph = dgl.graph(([0, 1, 2, 3, 5, 2], [1, 2, 3, 4, 3, 0]))

二、Graph2NLP

利用dgl.sampling.random_walk构造图结构数据,搜索节点[0, 1, 2, 3, 4, 5]4度以内的路径。

python 复制代码
paths = dgl.sampling.random_walk(graph, [0, 1, 2, 3, 4, 5], length=4)
paths[0].numpy().tolist()
def text_save(filename, data):#filename为写入CSV文件的路径,data为要写入数据列表.
    if os.path.exists(filename):
        os.remove(filename)
    file = open(filename,'a')
    for i in range(len(data)):
        s = str(data[i]).replace('[','').replace(']','').replace('-1','')#去除[],这两行按数据不同,可以选择
        s = s.replace("'",'').replace(',','') +'\n'   #去除单引号,逗号,每行末尾追加换行符
        file.write(s)
    file.close()
    print("保存成功")
text_save('data.txt', paths[0].numpy().tolist())

data.txt文本数据里的内容如下

python 复制代码
0 1 2 0 1
1 2 3 4 
2 0 1 2 0
3 4   
4    
5 3 4  

三、分析节点相似度

利用word2vec 分析data.txt文本数据,得到节点相似度。

代码如下:

python 复制代码
#coding:utf-8
import jieba
from gensim.models import Word2Vec
import gensim.models.word2vec as w2v
with open('data.txt',encoding='gb18030') as f:
    document = f.read()
    document_cut = jieba.cut(document)
    result = ' '.join(document_cut)
    print("type",type(result))
    with open('data_seg.txt', 'w',encoding="utf-8") as f2:
        f2.write(result)
model_file_name = 'data.model'
#模型训练,生成词向量
sentences = w2v.LineSentence('data_seg.txt')
model = Word2Vec(sentences, vector_size=100, window=5, min_count=1, workers=4)
model.save(model_file_name)
model = Word2Vec.load(model_file_name)
for vec in ['0','1','2','3','4', '5']:
    print('--%s--的似度' %(vec))
    print(model.wv.similar_by_word(vec, topn=15))
    print('\n')

结果分析

python 复制代码
--0--的似度
[('5', 0.13149002194404602), ('2', 0.0679759532213211), ('1', -0.013514956459403038), ('3', -0.04461709409952164), ('4', -0.11167057603597641)]

节点0与节点5、2的相似度较高。后续该idea考虑应用于实际业务场景中,分享应用案例。

相关推荐
DeepSCRM19 小时前
解构 Meta AI :从 Advantage+ 算法演进看跨境广告的“算力平权”
人工智能·社媒营销
日光明媚19 小时前
SoulX-FlashTalk 技术报告解读:从“严格因果”到“双向流式蒸馏”,实时数字人为什么能做到 0.87s 延迟、32FPS 和长时稳定?
人工智能·python·深度学习·ai作画·aigc·音视频
音视频牛哥19 小时前
鸿蒙 NEXT RTSP/RTMP 播放器如何回调 RGB 数据并实现 AI 视觉算法分析
人工智能·算法·harmonyos·鸿蒙rtmp播放器·鸿蒙rtsp播放器·鸿蒙next rtsp播放器·鸿蒙next rtmp播放器
测试界的段子手19 小时前
Ai名词解释
人工智能
飞Link19 小时前
掌控 Agent 的时空法则:LangGraph Checkpoint (检查点) 机制深度实战
开发语言·python·算法
donglianyou19 小时前
大模型提示词工程Prompt
人工智能·prompt·ai编程·大模型应用开发
ComputerInBook19 小时前
OpenCV图像处理——自适应阈值处理函数 adaptiveThreshold
图像处理·人工智能·opencv·自适应阈值处理
l143723326719 小时前
AI解说大师narrator-ai-cli:影视解说自动化工具,CLI架构让内容生产效率翻倍
运维·人工智能·自动化
乐迪信息19 小时前
智慧港口中AI防爆摄像机的船舶越线识别功能
大数据·人工智能·物联网·算法·目标跟踪
黑客说19 小时前
深耕AI,终破局:无限流游戏的核心创新之路
人工智能·游戏