AI 起步资源包:权重、数据集、提示词库的一次性整理
把我这半年攒下的 AI 项目素材一次整理干净。含常用模型权重索引、清洗过的中文数据集、90 条实测提示词模板和一套部署配置。
每次有人问「入门 AI 该下什么」,我都得零散地发一堆链接。这次索性整理成一个包,并且把每样东西该怎么用也写清楚。
包里的东西分成四类,按实用性排序。
一、部署与配置模板(最实用)
这部分是我自己项目里抽出来的,不是网上抄的:
deploy/
├── vllm/
│ ├── qwen-7b-24g.yaml # 单卡 24G 跑 7B 的稳妥配置
│ ├── qwen-32b-awq.yaml # 单卡 24G 跑 32B 量化
│ └── multi-model.yaml # 一张卡挂两个 7B 做路由
├── llamacpp/
│ └── desktop.sh # 桌面端自用,追求首 token 延迟
├── finetune/
│ ├── lora-7b.yaml # LoRA 全挂配置
│ └── qlora-7b.yaml # 显存不够时的降级方案
└── docker-compose.yml
每个 yaml 里都写了注释说明为什么是这个值,比如:
# 0.88 而不是 0.90:留出余量避免 KV Cache 抢占,
# 实测吞吐反而更高(详见 vLLM 调优那篇)
gpu_memory_utilization: 0.88
# 按线上 P99 长度 × 1.5 得出,不要按模型原生上限配
max_model_len: 8192
二、提示词库(90 条,都在真实项目里用过)
按任务类型分成 6 组,每条都标注了适用模型和实测效果。
| 分组 | 条数 | 典型用途 |
|---|---|---|
| 结构化输出 | 18 | 强制 JSON / 表格 / 固定字段抽取 |
| 文本改写 | 16 | 润色、压缩、换受众、调语气 |
| 代码相关 | 15 | 审查、改 bug、写测试、跨语言转换 |
| 长文本处理 | 14 | 摘要、定位、多文档对比 |
| Agent 系统提示 | 14 | 工具调用、任务拆解、失败恢复 |
| 兜底与纠错 | 13 | 拒绝幻觉、自我校验、格式修复 |
举个具体例子,结构化输出里最好用的一条:
从下面的文本中抽取信息,严格按 JSON 输出。
要求:
1. 只输出 JSON,不要有任何解释文字、不要用 markdown 代码块包裹
2. 找不到的字段填 null,不要编造
3. 日期统一格式化为 YYYY-MM-DD
4. 如果文本中一个字段出现了多次,取第一次出现的值
字段定义:
- company: 公司名称(字符串)
- amount: 金额(数字,单位元,不含货币符号)
- date: 签约日期(YYYY-MM-DD)
文本:
{{text}}
这条我在 Qwen2.5-14B 上测了 200 次,JSON 合法率 99.5%,字段准确率 94%。关键在「不要用 markdown 代码块包裹」这一条 —— 不加这句,模型有 30% 概率输出 `json ,程序解析直接失败。
三、清洗过的中文数据集
三个,都是我自己清洗并抽检过的:
| 数据集 | 条数 | 用途 | 来源与许可 |
|---|---|---|---|
| 中文指令跟随集 | 8,200 | SFT 微调的通用底座 | 公开数据清洗,CC-BY |
| 结构化抽取集 | 3,500 | 训练 JSON 输出能力 | 自建,可商用 |
| 多轮对话集 | 5,400 | 训练上下文保持 | 公开数据清洗,CC-BY |
清洗流程和我那篇 LoRA 笔记里写的一致:近似去重 → 长度过滤 → 模板化开头移除 → 格式校验 → 人工抽检 100 条。
特别说明「模板化开头移除」这一步:原始数据里有大量回答以「当然可以!」「这是一个很好的问题」开头。如果不删掉,微调出来的模型会把这个习惯学过去,每次回答都先客套一句,非常影响体验。
预览一下格式:
[
{
"instruction": "把下面这段话压缩到 50 字以内,保留所有数字",
"input": "本季度我们的模型推理服务总调用量为 1240 万次,相比上季度的 890 万次增长了 39.3%,平均单次延迟从 820 毫秒下降到 610 毫秒……",
"output": "本季度推理调用 1240 万次,环比增 39.3%,平均延迟从 820ms 降至 610ms。"
}
]
四、模型权重索引
我没有把权重打进包里(那会有几十上百 GB)。给的是一份索引表,列出每个用途下推荐的模型、量化版本和官方下载地址。
| 用途 | 推荐模型 | 量化 | 24G 单卡 |
|---|---|---|---|
| 通用对话 | Qwen2.5-14B-Instruct | AWQ | ✓ 19 GB |
| 中文写作 | GLM-4-9B-Chat | AWQ | ✓ 14 GB |
| 代码 | DeepSeek-Coder-7B | GPTQ | ✓ 12 GB |
| 长文本 | Mistral-Nemo-12B | AWQ | ✓ 17 GB |
| 极限压缩跑 | Qwen2.5-7B-Instruct | Q4_K_M | ✓ 6 GB |
| 嵌入模型 | bge-large-zh-v1.5 | FP16 | ✓ 1.3 GB |
索引表里每一项都附了 HuggingFace / ModelScope 的直链,以及显存占用实测值(不是标称值)。
使用建议
如果你是刚开始,我的建议顺序是:
- 先把
deploy/跑起来,能对话之后再研究别的 - 再把提示词库翻一遍,找到和你任务相似的那几条,改成自己的
- 最后才考虑微调。而且先用现成数据集跑一遍流程,确认自己需要微调,再去准备自己的数据
我见过太多人一上来就准备微调数据,结果折腾两周发现提示词工程就能解决。
关于更新
这个包我大概每季度更新一次,主要是补新模型和修正过时的配置。下载链接不会变,直接覆盖更新。
有想要但这里没有的资源,可以邮件告诉我 —— 如果是我用得上的,我会加进去。
资源下载
4 个入口- 百度网盘完整包,含数据集与提示词库,共 3.2 GB提取码ai2026
- 夸克网盘备用链接提取码qk88
链接若失效,欢迎发邮件告诉我,我会尽快重新上传。