利用大型语言模型从需求生成类模型

大型语言模型(LLMs)的出现为自动化软件工程活动开辟了新的可能性,这些活动传统上需要大量的人工投入。其中,类图生成是软件设计中一个关键但资源密集的环节。本文研究了包括GPT-5、Claude Sonnet 4.0、Gemini 2.5 Flash Thinking和Llama-3.1-8B-Instruct在内的最先进LLMs,从自然语言需求自动生成UML类图的能力。

为了评估基于LLM的模型生成的有效性和可靠性,我们提出了一种综合性的双验证框架,该框架将"LLM作为评判者"的方法与人机协同评估相结合。利用八个异构数据集,我们应用思维链提示来提取领域实体、属性和关联,并生成相应的PlantUML表示。

从五个质量维度对生成的模型进行评估:完整性、正确性、标准符合性、可理解性和术语一致性。两个独立的LLM评判者(Grok和Mistral)执行结构化的成对比较,并且它们的判断会进一步与专家评估进行对照验证。我们的结果表明,LLMs能够生成结构连贯且语义有意义的UML图,并与人类评估者达成高度一致。基于LLM的评估与人类评估之间观察到的一致性凸显了LLMs不仅在作为建模助手方面的潜力,而且在自动化需求工程工作流中作为可靠评估者的潜力,为LLM驱动的UML类图自动化的能力和局限性提供了实践洞察。

相关推荐
MindUp6 分钟前
AI辅助PPT生成工具的内容组织能力实测:8款产品的文档解析与排版效果对比
人工智能
寒草10 分钟前
【寒草呈献】当巴菲特走进 AI 投研助手
人工智能·架构
fthux19 分钟前
装闭 RenoPit 源码解析(06):SSE如何实时推送AI装修分析进度
人工智能·ai·开源·github·open source·renopit
AI备案指南-满满20 分钟前
大模型与算法备案全流程详解:从零到通过的完整指南
人工智能·算法·备案·大模型备案·算法备案
江畔柳前堤21 分钟前
LLM 训练核心机制深度解析:Warmup、Cosine Decay 与 Perplexity 的完整知识体系
网络·人工智能·深度学习·算法·机器学习·语音识别
龙虾PRO38 分钟前
把握人工智能时代机遇,夯实科技强国建设根基
人工智能·科技·百度
冬奇Lab1 小时前
企业知识库系列(00):在写第一行代码之前,先把评测数据集做好
人工智能
二川bro1 小时前
Obsidian+AI自生长知识库,告别无效笔记整理
人工智能
冬奇Lab1 小时前
开源项目第184期:MiroFish — 盛大出品的群体智能预测引擎,用数千 AI Agent 模拟社会演化来预测未来
人工智能·开源·资讯