AI 模型本地部署
AI 模型本地部署
站内搜索
直接问 AI

我的 SSRF 防护把自己拦了:当「解析到的地址」不是「要连的地址」

给本地模型加联网搜索,写了标准的出网防护,结果搜索稳定返回空——防护把维基百科和搜索 API 全拦了,而它的判断完全正确。根因是透明代理返回的合成地址落在 RFC 2544 保留段。这个「检查的对象不是使用的对象」的间隙,在同一个文件里出现了三次。

把三条已知的显存坑变成一个能用的估算器

查表覆盖不了变体×格式×上下文×卡数的组合爆炸,只能建模。这篇记录那次建模:公式的三项分别对应什么、全局注意力层占比这个查不到的量怎么用斜率测出来、并发数这个被忘掉的乘数如何让推理慢两个数量级,以及显存之外的两条硬约束——张量并行的整除要求和推荐排序为什么不能按体积。

量化验证的取样偏差:IoU 0.98 的模型如何在真实图片上掉到 0.30

区分模型间 IoU 一致性与对标注的质量,重新界定四项排查证据的边界。附五组 4×4 遮罩、阈值与 8 位取整反例、逐像素指标程序及完整记录;旧模型实验数字保留为待复核历史记录。

把本地大模型安全暴露到外网:Cloudflare 隧道与端口映射两条路线

两条完整可操作的暴露方案:零入站端口的 Cloudflare 隧道,和自建域名证书的直连端口映射。含 nginx 反代配置、DNS-01 签证书、DDNS 要点,以及端口转发配对了却连不上时的策略路由解法。

8GB 显卡自建 Gemma 4 推理网关:11 个只有实跑才会撞上的坑

在 8GB 显存的笔记本显卡上自建 Gemma 4 网关的完整实录:量化检查点比参数量大一倍、flash-attn 让 prompt 处理差 40 倍、端口转发配对了却因回包走错网关而握手失败、RAG 切分与中文全文检索的坑,每条都附实测数据。

向下探索