llama.cpp 模型部署8 张 2080Ti 上的两种切法:张量并行生成快,预填充却慢同一套卡、同一个模型,llama.cpp 的 --split-mode 从 layer 换成 tensor,token 生成变快了、预填充却慢了好几下。这篇文章把 layer split(流水线)和 tensor split(张量并行)到底切了什么、通信差在哪讲清楚,再用一套 8×2080 Ti 的实测数据,解释为什么这个差异会在生成和预填充两个方向上被放大。 醉月思📁 技术实践📅 2026-08-31
Node.js 模型部署pm2的相关操作记录本文记录了PM2进程管理器的常用操作命令,包括删除所有进程、启动脚本(fork模式)以及多进程启动的方法。同时提供了一个使用Node.js执行Hexo本地服务的脚本示例,适合Node.js开发者参考。 醉月思📁 技术实践📅 2019-10-28
Linux 模型部署推荐一个(神器级)服务器软件本文推荐了一款名为“宝塔”的服务器管理面板,将其视为服务器运维的神器。文章详细介绍了宝塔面板的功能特点,并以CentOS系统为例,图文并茂地演示了如何安装面板、部署LNMP环境、创建网站以及配置HTTPS SSL证书,帮助用户轻松实现服务器可视化管理。 醉月思📁 软件推荐📅 2019-02-16
django 模型部署python3 + Django + uwsgi + nginx 配置部署笔记本文详细记录了在Ubuntu系统下,使用Python3、Django、uWSGI和Nginx进行Web项目部署的全过程。涵盖了从环境搭建、组件安装、配置文件编写到最终域名映射的每一个步骤,并解决了常见的连接和编码问题,适合需要进行Django项目上线的开发者参考。 醉月思📁 学习笔记📅 2019-01-16