aiops

Zadig6 天前
后端·aiops
告别"人肉扛雷":Zadig 用 AI 接管发布前最脏最累的 15 分钟每次上线前,你是不是也在重复这七件事:打开代码扫描,肉眼确认有没有 Critical 漏洞——扫三遍才敢签字。打开测试报告,人工对比覆盖率波动——边缘值到底放不放过。打开监控告警,心里默数 P1 恢复时间——没恢复就开始慌。打开日志系统,逐条排查 ERROR——能归因的修,不能归因的算命。打开资源面板,心算 CPU/内存/连接池余量——够不够扛这一波。打开流量监控,评估当前 QPS 与峰值比——是不是踩了高峰窗口。
DogDaoDao8 天前
运维·python·程序员·kubernetes·aiops·sre·gitsops
运维技术全景:从基础设施到智能运维的体系化解析对运维最朴素的理解是"保证服务器不宕机"。但这个定义过于浅层——它只描述了运维的表面行为,没有触及本质。
玹外之音6 天前
aigc·工作流引擎·aiops
别做"AI 翻译"了,做"AI 本地化":跨境电商 Listing 系统的工程实践摘要:通用翻译是红海,但"懂电商规则的本地化"还是蓝海。本文分享一个人做跨境电商 AI 文案系统的完整技术方案:架构、选型、核心实现、踩坑与成本,供做类似产品的同学参考。
枝枝在Coding9 天前
ai编程·aiops
终端里加两个问号就能排障?我用完 Xterminal 小易,先把自动执行关了排查磁盘告警时,终端里同时开着测试机和生产机。我输入“找出最近 7 天超过 100MB 的日志??”,小易很快给出一条 find 命令。让我停下来的点不在命令语法,而在光标当时所在的标签页:如果直接按回车,AI 的建议就会从“候选答案”变成生产环境里的真实动作。
ManageEngine卓豪12 天前
aiops·可观测性·应用性能监控·运维监控·全栈可见性
全栈可见性落地指南:可观测性投入为何难以转化为实际可视能力ManageEngine《2025年可观测性现状报告》调研了1240名IT负责人与技术从业者,67.3%的受访者将"实现分布式及混合IT环境的端到端可视"列为采用可观测性方案的首要原因。然而部署之后,IT堆栈可视能力的改善程度却排在所有指标末尾。本文从这一数据反差出发,拆解全栈可见性难以落地的结构性原因,并给出可落地的技术实现路径。
观澜照影13 天前
aiops
RAG 到底神在哪?一个虚构的 WingFlow,让 LLM 当场现原形前面五篇你学会了 Token、Prompt、Embedding、向量库 Chroma、文档分块——零件齐了。这一篇把它们拼成一条线:一个端到端的最小 RAG 系统。我还造了一个"任何 LLM 都不可能知道"的虚构内部工具 WingFlow,专门用来看 RAG 到底能不能让模型"先现原形、再答对"。
IT大白鼠14 天前
架构·开源·aiops·openbao
OpenBao开源密钥管理系统:技术架构、核心功能与行业应用研究本文对OpenBao开源密钥管理系统进行全面技术评估和选型参考研究。OpenBao作为HashiCorp Vault的开源分支,由IBM工程师发起,旨在提供管理、存储和分发敏感数据的企业级解决方案。研究表明,OpenBao采用分层架构设计,包含HTTP/S API层、Barrier层、路径路由层和存储后端层,通过四阶段安全模型实现密钥管理。其核心功能包括动态密钥生成、加密即服务、证书管理、访问控制和安全审计,在金融、政务、能源等行业应用中展现出显著技术价值。与同类产品相比,OpenBao在开源许可、功能特
Nightwatchman22 天前
ai编程·aiops·cursor
AI 编程:追不完的工具,理得清的问题古早时候学编程,常听一句话:知其然,更要知其所以然。这句话听着有些老派。可多年以后再看,在喧嚣繁杂的技术潮水里,真正让人立得住的,还真就是这个道理。学网络编程,如果只记住 epoll 比 select 快,遇到高并发的连接超时依然会心虚;学面向对象,如果只背下那几个设计模式,写出来的也可能仍然是套着类外壳的过程式面条代码。工具和概念当然要学,但工具为什么出现,它到底在解决什么问题,这背后的来龙去脉如果想不清楚,学得越多,反而越容易迷失方向。
龙智DevSecOps解决方案1 个月前
atlassian·devops·aiops·jira·itsm·智能运维
ITSM选型指南 | Jira Service Management Standard vs Cloud Premium 版本对比与升级指导企业对 IT 服务管理的期望早已超越了传统的”工单系统”范畴。开发、运维、业务团队之间的协作壁垒,日益复杂的变更流程,以及频繁涌现的安全事件,都在倒逼企业寻找一个更敏捷、更智能、更具扩展性的服务管理平台。
SRETalk1 个月前
aiops·可观测性·nightingale·开源监控
夜莺监控发布V9正式版,引入AI去年 v8 发布的时候,我们在发布文章里开过一个玩笑:「V8 这个版本的产品完成度已经很高,明年的 V9 我都不知道该搞什么大的迭代了。」
tonydf1 个月前
后端·容器·aiops
传统老手艺之容器编排前阵子参加了一个 AI 创意比赛,项目是一个在线考试系统,有管理后台和考生答题端两个子系统。作品的评审环节需要提供一个可演示的测试环境。
武子康1 个月前
人工智能·agent·aiops
Shippy 全拆:3 个集合收缩(动作 / 状态 / 后果)+ 4 类边界(版本化行为 / Typed API / CLI / Sandbox)**摘要:**高风险 Agent 的可靠性不能只押注于模型更强。Shippy 的工程价值 在于用版本化行为工件、确定性 CLI、会话隔离和整套 Agent Eval,持续缩小 动作空间、状态空间与错误后果。
云智慧Cloudwise1 个月前
aiops·itsm·智能运维平台·ai运维平台·it服务管理平台
企业级智能服务闭环落地实践:好用的轻帆云 ITSM 集成 AI 智能体全流程方案详解随着大语言模型(LLM)和 AI Agent 快速发展,越来越多企业开始重新思考 IT 服务管理(ITSM)的建设方向。
行者-全栈开发2 个月前
aiops·ai 辅助开发·ai 运维脚本·shell 自动化·python 运维·运维提效·prompt 工程
用 AI 大模型重写运维脚本:5 个真实场景的提效实录💡 摘要: 本文基于我在运维岗位的实战经验,展示 5 个常见运维脚本从手动编写到 AI 生成的完整对比。通过量化数据展示 AI 辅助脚本开发如何将平均编写时间从 45 分钟缩短到 5 分钟,脚本错误率从 18% 降到 3%。包含 5 个场景的脚本对比、2 张提效数据图、3 个踩坑案例,帮助运维工程师快速掌握 AI 辅助脚本开发的方法。
IguoChan2 个月前
aiops
3. d2l — 多层感知机(MLP)在第三章中,我们已经学习了线性回归和softmax回归。它们其实都可以看作线性模型:或者对于多分类问题:
用户723429355332 个月前
aiops
训练任务从提交到运行:完整链路和排障地图这份文档解决一个问题:当一个训练任务出问题时,你应该先判断它卡在哪一层,而不是一上来就随机翻日志。训练任务的主链路可以记成一句话:
用户723429355332 个月前
aiops
Kubernetes 基础对象:Pod、Job、Deployment、Service 等这份文档先补 Kubernetes 基础概念。训练平台、推理平台、MLOps 平台最终都要落到 Kubernetes 对象上,所以必须先知道这些对象是什么、解决什么问题、彼此怎么关联。
析数塔2 个月前
agent·测试·aiops
AI 时代测试开发新范式:从用例验证到 Agent 评测体系本文从 DeepSeek 测试开发岗位的招聘需求出发,聊聊 AI 时代测试岗位正在发生的变化,以及测试开发者可以如何应对。
SRETalk2 个月前
aiops·categraf
如何使用 AI 解答开源项目的问题,其实只需要一句话昨天社区小伙伴问了一个问题:说:在 Categraf 中采集 es-exporter 的数据,明明配置了 insecure_skip_verify = true 为什么还是报错:x509: cannot validate certificate for 10.0.x because it doesn't contain any IP SANs。