【第十三届“泰迪杯”数据挖掘挑战赛】【2025泰迪杯】【论文篇+改进】A题解题全流程(持续更新)

【第十三届"泰迪杯"数据挖掘挑战赛】【2025泰迪杯】【论文篇+改进】A题解题全流程(持续更新)

写在前面:

  1. 我是一个人,没有团队,所以出的比较慢,每年只做一次赛题,泰迪杯,我会认真对待,尽量做到创新、质量有保证,包售后。
  2. 本节主要是论文更新,同步会出论文的创新点编写、改写、论文每个章节修改建议,变相降重指导,(以word批注的方式写在章节旁边)。
  3. A题说难也难,说不难也不难;我也看到过相关的其他人的,(例如数模团队、bi站)但如果只是用传统的方法PDF属性去解题,那没有什么创新,只是为了解题而做题,至于像论文重复率计算还使用tf-idf这种古老的句子相似度算法拿来做论文超长文本,PDF属性+re正则匹配来获取信息,有点...。。。。 赛题都提示你要用AI大模型了。

接下来进度:

一、改进代码:

  • 根据同学硬件条件可能不满足情况,修改代码的大模型部分,改为免费API调用,不用本地部署使用大模型
  • 优化代码,将改换版面分析模型+视觉大模型进行论文信息重新提取,问题一尽量减少大模型的模糊使用,利用准确的版面分析提取出论文信息,(例如目录不用大模型识别,版面分析加入目录的检测标签)
  • 问题三的图片与公式雷同,可能去掉繁琐的clip导出特征,替换深度学习网络提取图片特征即可,因为都是一个原理,clip更偏向于图文检索,图图检索只是可以满足。

二、至于C题

  • 高估了自己空闲情况,白天要上班加班,所以C题就不出论文了,我抓紧在正式比赛前做完代码部分
  • 届时会低价出c题的代码包与结果。并且同步更新正式比赛
  • c题包括数据结果化预处理、langchian-chatchat复现教程、配置环境镜像分享(基于服务器就可以直接运行,找我分享服务器镜像,不用再配置环境了)、问题二三解决代码

论文展示:

论文结构清晰,按照历届泰迪杯特等奖论文结构写作。2w字。并会包含完善论文改进、降重、个性化写作避免重复的批注建议在旁边。

正式比赛时也会同步更新至售后群

A题全家桶获取:

烦请移步社区

全家桶包含:

A题代码+结果单品一获取:

烦请移步社区

往届泰迪杯情况:

相关推荐
聚客AI10 小时前
🌟大模型为什么产生幻觉?预训练到推理的漏洞全揭秘
人工智能·llm·掘金·日新计划
Juchecar10 小时前
一文讲清 nn.Sequential 等容器类
人工智能
阿里云云原生11 小时前
如何快速看懂「祖传项目」?Qoder 强势推出新利器
人工智能
美团技术团队11 小时前
LongCat-Flash:如何使用 SGLang 部署美团 Agentic 模型
人工智能·算法
程序员小袁12 小时前
基于C-MTEB/CMedQAv2-rerankingv的Qwen3-1.7b模型微调-demo
人工智能
飞哥数智坊13 小时前
AI 编程一年多,我终于明白:比技巧更重要的,是熟练度
人工智能·ai编程
新智元14 小时前
收手吧 GPT-5-Codex,外面全是 AI 编程智能体!
人工智能·openai
IT_陈寒14 小时前
Java 性能优化:5个被低估的JVM参数让你的应用吞吐量提升50%
前端·人工智能·后端
阿里云云原生14 小时前
阿里云基础设施 AI Tech Day AI 原生,智构未来——AI 原生架构与企业实践专场
人工智能
Memene摸鱼日报15 小时前
「Memene 摸鱼日报 2025.9.16」OpenAI 推出 GPT-5-Codex 编程模型,xAI 发布 Grok 4 Fast
人工智能·aigc