最新推荐单卡 4090 部署 32B 模型:显存怎么算,方案怎么选从显存估算公式开始,实测 vLLM、llama.cpp、TensorRT-LLM 三种方案在 4090 上的吞吐与延迟,给出不同场景下的选择建议。…vLLM量化显存优化阅读全文
模型部署推荐单卡 4090 部署 32B 模型:显存怎么算,方案怎么选从显存估算公式开始,实测 vLLM、llama.cpp、TensorRT-LLM 三种方案在 4090 上的吞吐与延迟,给出不同场景下的选择建议。…2026 年 3 月 16 日4 分钟资源
Agent用 MCP 搭一套 Agent 工具链:踩过的坑和最终架构从最小可用的工具调用循环开始,讲清工具描述怎么写、上下文怎么管、多步任务为什么会跑飞,以及我最后收敛到的架构。2026 年 2 月 26 日3 分钟资源
工具测评本地模型横评:8 个 7B~14B 模型在同一套题上的实测用 120 道固定的中文任务题,测了 8 个能本地跑的中等规模模型。含评分标准、原始数据表和我的选型结论。2026 年 2 月 14 日4 分钟资源
性能优化vLLM 性能调优:把吞吐从 1200 提到 3400 tok/s一次完整的推理服务优化记录。连续批处理、PagedAttention、前缀缓存、投机解码,每一项带来多少提升都有实测数字。2026 年 1 月 30 日4 分钟资源
资源包AI 起步资源包:权重、数据集、提示词库的一次性整理把我这半年攒下的 AI 项目素材一次整理干净。含常用模型权重索引、清洗过的中文数据集、90 条实测提示词模板和一套部署配置。2026 年 1 月 18 日3 分钟资源