DeepSeek-V4-Flash 剪枝手术门禁全记录:从 T2 合并到 W512,双路线判死复盘
284B MoE 模型 hash 层专家合并(T2)与宽度裁剪(W512)两条路线的 ppl 门禁执行全记录:完整操作、每个坑、根因分析与经验教训
把 Qwen3-Next-80B 搬上 48G 显存:一场从 MUSA 到 CUDA 的迁徙
记录一次把 Qwen3-Next-80B-A3B-Thinking 跑起来的全过程:先是拿到了摩尔线程 S4000(48G 显存 + 100G 内存)以为万事大吉,结果被宿主机驱动 2.7.0 卡死;换 NVIDIA 4090 后又掉进 vllm 0.27 + torch 2.13 的兼容连环坑;最后用 CPU offload 6G 才把 45G 的 4-bit 权重塞进 48G 显存。服务起来了,但输出是乱码——故事还没完。
拿1km² OSM数据对比全球11城,韶关到底画得怎么样:一次城市测绘质量的量化分析
从Overpass API下载全球11个城市市中心1km²的完整OSM数据,建立6维度评分体系量化对比,逐步引入水域修正、3D建筑、室内道路、军事区域扣除、城市能级修正,最终发现韶关的映射效率超过1.0——画得已经超出了这个四线城市的应有水准
让三家大模型给我的训练数据重答:一次蒸馏实验的流水账
把模型答砸的 7699 条对话丢给 Kimi K3、GLM 5.3、DeepSeek V4 Pro 三家重答再选优。记录三家 agent 的真实工作方式:GLM 搭流水线、DeepSeek 硬编码直写、Kimi 一次性生成,以及我从中看到的东西
让三家大模型重答实验(二):盲测结果与 DeepSeek 的红温时刻
7699 条失败对话重答实验的后续:8 份盲测记录、185 题的统计结果(GLM 48.6% / Kimi 42.7% / DeepSeek 8.6%),以及 DeepSeek V4 Pro 在跑到 250/7699 时拒绝继续、留下一份进度脚本就停摆的全过程。所有数据均有可验证来源。
把 284B 的模型剪成 70B:我在量化空间里做的一场手术
给「卷心菜」做一个 284B → ~70B 的瘦身手术,但规矩是:只能在量化(FP8/FP4)空间里动刀,只准删、不准算。记录这场手术里遇到的最有意思的事——被 58% token 改嫁吓到的 hash 路由、在 2GB 内存里算 256×256 相似度矩阵、以及一个脾气很大的 vLLM 裁判
创业如何成功
先帝创业未半而中道崩阻,好产品在没有高成本的情况下是否真的可以广泛的出售
一个关于键政的讨论
莫谈国事的当代为何还有键政
导管和吃戊酸雌二醇/涂雌二醇凝胶哪个伤害大
我是xyn喵~
当我试图用API"搬空"整个广东省的地图数据
一次下载21座城市OSM数据的折腾记录——从被限流到找到捷径,以及中间踩过的那些XML解析的坑
Profile Image of the Author
小原酱
世界第二可爱的小原酱~
分类
标签
站点统计
文章
40
分类
4
标签
77
总字数
70,147
运行时长
0
最后活动
0 天前

目录