跳到正文

AI 起步资源包:权重、数据集、提示词库的一次性整理

把我这半年攒下的 AI 项目素材一次整理干净。含常用模型权重索引、清洗过的中文数据集、90 条实测提示词模板和一套部署配置。

900 字约 3 分钟直达下载 ↓
本文目录(6)

每次有人问「入门 AI 该下什么」,我都得零散地发一堆链接。这次索性整理成一个包,并且把每样东西该怎么用也写清楚。

包里的东西分成四类,按实用性排序。

资源包结构:四类内容与规模
资源包结构:四类内容与规模

一、部署与配置模板(最实用)

这部分是我自己项目里抽出来的,不是网上抄的:

deploy/
├── vllm/
│   ├── qwen-7b-24g.yaml          # 单卡 24G 跑 7B 的稳妥配置
│   ├── qwen-32b-awq.yaml         # 单卡 24G 跑 32B 量化
│   └── multi-model.yaml          # 一张卡挂两个 7B 做路由
├── llamacpp/
│   └── desktop.sh                # 桌面端自用,追求首 token 延迟
├── finetune/
│   ├── lora-7b.yaml              # LoRA 全挂配置
│   └── qlora-7b.yaml             # 显存不够时的降级方案
└── docker-compose.yml

每个 yaml 里都写了注释说明为什么是这个值,比如:

# 0.88 而不是 0.90:留出余量避免 KV Cache 抢占,
# 实测吞吐反而更高(详见 vLLM 调优那篇)
gpu_memory_utilization: 0.88

# 按线上 P99 长度 × 1.5 得出,不要按模型原生上限配
max_model_len: 8192

二、提示词库(90 条,都在真实项目里用过)

按任务类型分成 6 组,每条都标注了适用模型和实测效果。

分组条数典型用途
结构化输出18强制 JSON / 表格 / 固定字段抽取
文本改写16润色、压缩、换受众、调语气
代码相关15审查、改 bug、写测试、跨语言转换
长文本处理14摘要、定位、多文档对比
Agent 系统提示14工具调用、任务拆解、失败恢复
兜底与纠错13拒绝幻觉、自我校验、格式修复

举个具体例子,结构化输出里最好用的一条:

从下面的文本中抽取信息,严格按 JSON 输出。

要求:
1. 只输出 JSON,不要有任何解释文字、不要用 markdown 代码块包裹
2. 找不到的字段填 null,不要编造
3. 日期统一格式化为 YYYY-MM-DD
4. 如果文本中一个字段出现了多次,取第一次出现的值

字段定义:
- company: 公司名称(字符串)
- amount: 金额(数字,单位元,不含货币符号)
- date: 签约日期(YYYY-MM-DD)

文本:
{{text}}

这条我在 Qwen2.5-14B 上测了 200 次,JSON 合法率 99.5%,字段准确率 94%。关键在「不要用 markdown 代码块包裹」这一条 —— 不加这句,模型有 30% 概率输出 `json ,程序解析直接失败。

三、清洗过的中文数据集

三个,都是我自己清洗并抽检过的:

数据集条数用途来源与许可
中文指令跟随集8,200SFT 微调的通用底座公开数据清洗,CC-BY
结构化抽取集3,500训练 JSON 输出能力自建,可商用
多轮对话集5,400训练上下文保持公开数据清洗,CC-BY

清洗流程和我那篇 LoRA 笔记里写的一致:近似去重 → 长度过滤 → 模板化开头移除 → 格式校验 → 人工抽检 100 条。

特别说明「模板化开头移除」这一步:原始数据里有大量回答以「当然可以!」「这是一个很好的问题」开头。如果不删掉,微调出来的模型会把这个习惯学过去,每次回答都先客套一句,非常影响体验。

预览一下格式:

[
  {
    "instruction": "把下面这段话压缩到 50 字以内,保留所有数字",
    "input": "本季度我们的模型推理服务总调用量为 1240 万次,相比上季度的 890 万次增长了 39.3%,平均单次延迟从 820 毫秒下降到 610 毫秒……",
    "output": "本季度推理调用 1240 万次,环比增 39.3%,平均延迟从 820ms 降至 610ms。"
  }
]

四、模型权重索引

我没有把权重打进包里(那会有几十上百 GB)。给的是一份索引表,列出每个用途下推荐的模型、量化版本和官方下载地址。

用途推荐模型量化24G 单卡
通用对话Qwen2.5-14B-InstructAWQ✓ 19 GB
中文写作GLM-4-9B-ChatAWQ✓ 14 GB
代码DeepSeek-Coder-7BGPTQ✓ 12 GB
长文本Mistral-Nemo-12BAWQ✓ 17 GB
极限压缩跑Qwen2.5-7B-InstructQ4_K_M✓ 6 GB
嵌入模型bge-large-zh-v1.5FP16✓ 1.3 GB

索引表里每一项都附了 HuggingFace / ModelScope 的直链,以及显存占用实测值(不是标称值)。

使用建议

如果你是刚开始,我的建议顺序是:

  1. 先把 deploy/ 跑起来,能对话之后再研究别的
  2. 再把提示词库翻一遍,找到和你任务相似的那几条,改成自己的
  3. 最后才考虑微调。而且先用现成数据集跑一遍流程,确认自己需要微调,再去准备自己的数据

我见过太多人一上来就准备微调数据,结果折腾两周发现提示词工程就能解决。

关于更新

这个包我大概每季度更新一次,主要是补新模型和修正过时的配置。下载链接不会变,直接覆盖更新。

有想要但这里没有的资源,可以邮件告诉我 —— 如果是我用得上的,我会加进去。

资源下载

4 个入口

链接若失效,欢迎发邮件告诉我,我会尽快重新上传。