先交代一下背景。我手上有一套跑了一年多的Nacos集群,注册中心和配置中心都挂在上面,业务端是Spring Cloud Alibaba体系,还有一部分Dubbo服务也走Nacos做服务发现。年初排进信创改造清单,第一项就是把Nacos内置的Tomcat替换成保兰德的应用服务器中间件(资料里也有写作宝兰德的,同一家)。改造过程中踩了不少坑,也和中间件厂商来回拉锯了好几轮。这篇就把整个替换思路、实操步骤和问题排查方法整理出来,给后面要做同样事情的同学做个参照。
先说个基本判断:这个活儿的难点不在“换一个中间件”本身,而在“换完之后Nacos还能不能按原来的方式工作”。Nacos封装得很深,内置Tomcat是它对外提供HTTP服务的基础设施,控制台界面、开放API、配置拉取、服务注册,全都走这一层。你把它换掉,本质上不是删一个组件再加一个组件,而是把Nacos的运行时环境换了,牵一发动全身。所以动工之前,我建议先把下面这几个问题想清楚,再决定怎么改。
1. 改造前先搞懂:Nacos里Tomcat到底是干什么的
1.1 Nacos的架构里,Tomcat管着哪一块
Nacos拆开看,服务端就两大块职责:注册中心和配置中心。对外表现上,控制台页面是一套Web应用,Open API是一组HTTP接口,客户端SDK拉配置、注册实例、发送心跳,也都是通过HTTP或gRPC协议与服务端交互的。
在Nacos 1.x时代,服务端基本就是一个Spring Boot应用,内嵌了Tomcat作为Servlet容器,负责接收所有HTTP请求。控制台的静态资源、接口路由、鉴权过滤器,全在Tomcat的容器里跑。到了2.x版本,虽然引入了gRPC作为客户端长连接通信的主通道,控制台和一大半HTTP API依然走的是内置Tomcat。也就是说,你通过浏览器打开Nacos的控制台,或者用curl调它的Open API,背后处理的都是这个内置Tomcat。
说人话就是:Nacos从设计之初就默认“你是跑在内嵌Servlet容器里的”,它不是一个可以直接扔到任意Java应用服务器里跑的标准Web应用。做信创替换时,需要把它改造成可以被外置应用服务器接管的形式,这就是整个改造的核心。
1.2 替换前必须想清楚的三个问题
第一个问题:替换范围。你换的是HTTP层的内置Tomcat,还是连2.x的gRPC通道一起换?保兰德中间件是应用服务器,它接管的是Servlet规范的请求处理,gRPC是另一个协议,不在同一层。改造时通常只替换HTTP/Servlet这一层,gRPC端口和通讯逻辑保持原样。
第二个问题:对外端口和协议。Nacos原来的8848端口提供HTTP服务,9848端口提供gRPC服务,9849是gRPC服务端向集群其他节点同步用的端口。改造后,8848上的HTTP服务由保兰德接管,端口规划需要重新设计,不能和保兰德默认端口冲突。
第三个问题:数据与集群层面。Nacos的配置数据、服务实例数据都存在它的存储层(默认是内嵌Derby,生产建议用MySQL),这部分和运行容器完全解耦。替换Tomcat不会动数据和集群成员的选举逻辑,但这个前提是改造过程中不能引入对配置目录、数据目录的破坏性改动。
1.3 为什么非要把“中间件”这个身份落实下来
从纯技术角度讲,Nacos继续用内置Tomcat一点问题没有,跑得还挺稳。但信创改造看的不只是功能,还看整条技术链路上每个组件是否有明确的产品形态、生命周期、安全可控性。内置Tomcat是Nacos代码里的一个依赖,它没有独立的交付形态,运维侧无法对它做单独的安全加固、补丁升级、运行监控。保兰德应用服务器是一个标准的、可独立部署的中间件产品,有完整的管理控制台、启停脚本、安全配置体系,符合应用服务器类中间件的替换要求。
理解了这一点,就不会陷入“到底有没有必要换”的纠结里。接下来就是在技术层面把替换变成一件可控的事。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 改造前的环境准备与风险评估
2.1 版本选型:Nacos和保兰德的兼容性怎么对
版本兼容是整个改造里最容易出问题的地方。Nacos 1.x比较老,内置Tomcat的逻辑和Spring Boot版本都比较旧,放到新版保兰德上可能出现Servlet API版本不匹配、JSP引擎缺失等问题。Nacos 2.x的内置Tomcat和依赖体系新一些,但2.x引入了gRPC,改造时要处理的东西更多——不是不好改,而是要评估清楚。
我的建议是:如果条件允许,先把Nacos升级到2.2.0以上的稳定版本再做替换,版本太老会增加适配成本。保兰德中间件要选支持Servlet 4.0或更高规范、JDK版本能对上Nacos要求的产品版本。Nacos 2.x要求JDK 8起步,官方推荐JDK 8或JDK 11,选保兰德时也要确认它对JDK版本的支持范围。我们当时环境是JDK 8 + Nacos 2.2.3 + 保兰德应用服务器,整体还算顺利。
2.2 改造时机:是迁移期顺手做,还是原地硬改
Nacos是注册中心,属于核心依赖,改造时如果操作不当会造成服务掉线。我建议把改造和一次相对完整的Nacos容灾演练结合起来做。比如先搭一套透明的新环境,把配置和服务数据同步过去,验证没有问题以后再切流量,这样比在现网环境上原地替换要稳妥得多。实际操作上,很多公司都是把“替换Tomcat”和“Nacos迁移/升级”打包在同一次变更窗口里执行,既减少了变更频次,也降低了风险叠加的概率。
2.3 动手前的检查清单
我在改造前拉了一个清单,每项都得确认清楚,供你参考:
- 现有Nacos版本、集群节点数、存储模式(默认还是MySQL)、配置文件位置。
- 客户端连接方式:用的Spring Cloud Alibaba的Nacos Discovery/Config,还是原生SDK,或者Dubbo的Nacos注册中心。版本号分别是什么,对服务端的兼容范围是什么。
- 是否使用了命名空间、分组、权限控制,改造后这些配置信息不能丢。
- 对外暴露的域名、负载均衡、安全组策略,改造后端口变化需要同步调整。
- 监控告警:Nacos自身指标、JVM指标、业务探活指标,替换后探活方式和端口都可能变化。
这些信息直接决定替换方式和工作量,别跳过。
3. 核心原理:从“内嵌容器”到“外置应用服务器”的迁移模型
3.1 Nacos的Web能力是怎么从“内置”变成“外置”的
Nacos服务端代码里,控制台和Open API是打包在应用内部的,启动时由Spring Boot的内嵌Tomcat加载。这就像一台设备出厂时把电源模块集成在主板上,它不是不能改装成“外接电源”,但要先把电源接口和主板对好。
放到Nacos的例子里,“主板”就是Nacos的核心服务模块(Naming、Config、Core),“电源接口”就是Servlet规范定义的Web应用部署单元。Nacos控制台本来应该是一个标准的WAR包,因为在Spring Boot里它被内嵌容器直接加载了,所以没有以WAR形态暴露出来。
替换的思路就是:把Nacos控制台/接口部分做成可以被外部Servlet容器加载的形式,再把保兰德应用服务器指向这个应用,由它来创建Servlet上下文、管理生命周期。后续所有HTTP请求先到保兰德,再由保兰德转给Nacos的核心服务,核心服务本身不需要做太大改动。
3.2 保兰德中间件在整条链路上的位置
改造后,保兰德应用服务器的位置等同于原来Tomcat的位置,但有一些额外事项需要处理:
- 进程管理与生命周期:以前你启停Nacos是一条命令,改了以后要先启保兰德,再由保兰德加载Nacos应用。
- 端口管理:保兰德默认监听端口可能是8080(或管理控制台的其他端口),需要把HTTP端口调整到Nacos原来的业务端口,或者通过负载均衡转发。
- ClassLoader隔离:应用服务器对每个部署应用有独立的类加载器,Nacos内置依赖和应用服务器自身依赖之间要避免冲突。
- 安全加固:保兰德本身提供安全配置、线程池配置、日志配置,替换之后这些能力接管了原来Tomcat的那部分工作。
3.3 改造前后请求链路对比
改造前:
客户端HTTP请求 -> Nacos进程内嵌Tomcat -> Nacos核心服务(Naming/Config/Core) -> 存储层。
改造后:
客户端HTTP请求 -> 保兰德应用服务器(Servlet容器) -> 加载的Nacos应用(控制台和API逻辑) -> Nacos核心服务 -> 存储层。
从链路看只是多了一层,但这层“接管”了你原来的网络入口,所以涉及的网络策略、负载均衡、健康检查全部要跟着调整。gRPC通道不受影响,还是Nacos自己监听9848端口,这一点我在改造初期没特别重视,后来排查客户端连接问题时才反应过来,希望你不要踩这个坑。
4. 实操:把保兰德中间件接进Nacos替换内置Tomcat
4.1 准备部署单元:让Nacos以标准Web应用形态出现
正常情况下Nacos官方发行版是直接可执行的,不会给一个WAR包让你扔到Tomcat里。所以第一步是构建一个可被外置容器加载的部署单元。
我实践下来的做法是这样的:
- 下载Nacos对应版本的源码包,建议用官方GitHub上打了tag的版本,不要用master分支。
- 找到console模块,也就是控制台模块。这个模块承载了管理端页面和大部分HTTP API。
- 调整打包方式:在console模块的pom.xml里,把spring-boot-maven-plugin相关配置做屏蔽或调整,同时把打包类型改成war。
- 改造启动类:Nacos的ConsoleApplication默认是Spring Boot的入口类,需要继承SpringBootServletInitializer并重写configure方法,这样外置容器启动时才能正确加载Spring上下文。
这里有一个关键点:Nacos不是只有一个console模块,它还包含naming、config、core等核心模块。改造war包时,要确保这些核心模块被作为依赖打包进war里。我当时是在console模块的pom里把其他模块依赖加上,然后整体编译,得到一个完整的war包。不同小版本对模块依赖的处理略有差异,编译报错就顺着依赖补齐即可。
另外,如果你不想自己从源码构建,也可以直接在官方tar包的应用目录结构基础上做改造——把console相关class和依赖整理成符合WAR规范的目录,再部署到保兰德。这种做法适合对Nacos代码结构非常熟悉的人,否则容易缺依赖,建议还是走源码构建的路。
4.2 修改配置文件:路径、数据源、端口一起调
Nacos的配置主要在application.properties里。从内嵌Tomcat切到外置容器后,有几个配置项必须针对性地改:
- server.port:应用服务器接管后,端口由保兰德的应用配置或部署配置决定。可以保持原8848的对外端口语义,把保兰德的HTTP端口改成8848,这样客户端无需调整连接地址。如果你不想动保兰德的全局配置,也可以在Nacos的war资源配置里指定,具体以保兰德部署配置为准。
- server.servlet.context-path:Nacos默认没有context-path,部署到保兰德时要确认是否需要设置。如果war包名是nacos-console,容器默认会把应用挂在/nacos-console路径下,这会直接导致前端静态资源的路径变成/nacos-console/nacos/,需要统一规划。我们最后把war包名处理成nacos,并设置了context-path为/nacos,确保路径清晰。
- spring.datasource.platform和数据库连接信息:这部分在Nacos的配置文件里明确定义,改造后保持不变。如果原来用的是外部MySQL,替换Tomcat不会影响数据访问。如果是默认的Derby,建议趁这次改造把存储切换成MySQL,否则集群部署时容易出现数据不一致问题。
- nacos.core.auth.*相关配置:如果是Nacos 2.2以上版本,服务端默认开了鉴权相关配置项,改造后要检查auth身份标识、token等配置是否还在生效,防止因为启动方式变化导致鉴权失效。
4.3 在保兰德中间件中部署Nacos应用
保兰德安装完成并启动后,我习惯把它当成一个标准的Java应用服务器来用。部署流程大致是:
- 进到保兰德的部署管理界面,找到应用部署入口,上传之前构建好的war包。
- 指定应用名称和访问路径,建议与Nacos原本的context path保持一致,避免路径变化引发前端访问问题。
- 部署完成后启动该应用,观察启动日志,确认Spring容器初始化成功、Nacos核心服务正常加载。
- 检查应用端口监听情况:HTTP端口由保兰德接管,gRPC端口(9848)由Nacos自己的服务监听,两个都要在。
部署过程中有两点要特别留意。鼠标点界面配置时,看清楚JVM参数面板,建议把原来的Nacos启动参数(如堆内存大小、GC策略)填进去,否则应用服务器默认参数可能导致内存不足或频繁Full GC。另外,保兰德本身也是一个Java进程,它需要占用一套资源,Nacos又是相对吃内存的应用(尤其配置多、服务多的时候),节点内存建议至少给到8GB以上。
4.4 启动参数和权限配置调整
从源码改造的Nacos war包部署到保兰德后,有些环境相关的参数要从保兰德侧注入,而不是Nacos原来的启动脚本。举几个例子:
- 日志路径:Nacos默认日志目录在启动脚本里定义,替换后日志输出目录可能被保兰德接管,需要在保兰德的JVM参数里设置logback相关路径(例如-Dnacos.logs=/data/logs/nacos),否则日志会散落在保兰德默认目录下。
- 临时文件目录:Nacos会用到缓存和临时文件,默认目录在软件安装路径下。通过-Djava.io.tmpdir可以指定独立临时目录,避免和应用服务器的临时目录混淆。
- 安全策略:如果保兰德自带安全管理器或启用了安全策略,需要对Nacos的目录、数据库驱动加载等放行,否则启动过程中会报AccessControlException。
这些参数看着琐碎,但缺一个就会多踩一个坑。建议把改造后的启动命令和参数完整记录下来,后面克隆节点或者升级的时候直接照用。
4.5 功能验证:注册和配置必须都走一遍
替换完成后,先把基础功能验证跑通。我是这样逐项验的:
- 控制台访问:浏览器打开http://
: /nacos,确认登录、命名空间列表、服务列表、配置列表页面正常。 - Open API调用:用curl调几个关键接口,比如查询服务列表、发布配置、获取配置,确认HTTP API返回正常。
- 客户端注册:启动一个Spring Cloud服务,配置Nacos地址指向改造后的地址,确认服务能注册成功,控制台能看到实例列表。
- 配置动态刷新:通过控制台修改一条已发布的配置,观察客户端是否能实时收到变更通知。
- 集群同步:如果是多节点集群,确认节点之间配置数据和服务数据同步正常。Nacos集群节点间除了HTTP,还涉及gRPC通信,替换后要确认9848端口在集群各节点之间网络可达。
这一步验证建议做成表格,每项记录测试时间、操作人、结果,不要脑子记一说过就完事。毕竟这是生产环境要用的东西,后续如果出了问题,这套验证记录就是你排查的对照基线。
5. 常见问题与排查技巧实录
5.1 类加载冲突:最典型的“换了容器就报错”
把Nacos从内嵌Tomcat换到保兰德后,最常见的报错就是NoSuchMethodError、ClassNotFoundException、重复类定义,本质上是类加载顺序和ClassLoader隔离机制变了。
我遇到过一个很典型的问题:Nacos里的某个依赖版本和保兰德自带的类库版本不一致,启动时使用了应用服务器的类,结果因为方法签名不匹配直接报AbstractMethodError。排查方法是开启保兰德的类加载日志,或者在启动参数里调整类加载策略,让应用优先加载自己war包内的类。具体参数每个版本不太一样,但思路是统一的:在应用中使用的第三方类库里,优先使用打包进war的版本,避免被应用服务器的同名类覆盖。
另一个相关问题是JSP或视图模板资源加载失败。如果保兰德默认不启用JSP引擎或者JSP编译器版本和Nacos用到的模板技术不匹配,控制台页面可能能出HTML但部分菜单点击后白屏。遇到这类现象,先看日志里的模板引擎报错,再按保兰德文档确认是否需要额外启用JSP支持。
5.2 端口和协议:8848还在,9848也要管
很多人在改造后检查,发现Nacos的HTTP接口看着正常,但客户端一直连不上或者不稳定,一查日志才发现gRPC端口没开。
Nacos 2.x的客户端SDK和服务端的通信方式是:客户端先通过HTTP接口获取服务端节点列表,然后建立gRPC长连接。gRPC默认端口是主端口+1000,也就是如果HTTP端口是8848,gRPC端口就是9848。改造后,HTTP端口被保兰德接管了,你可以在保兰德上把HTTP端口配置为8848,但gRPC端口还是由Nacos进程监听,和保兰德没关系。
所以网络策略要同时放行两部分:客户端到保兰德端口(如8848)的HTTP连接,以及客户端到Nacos进程端口(9848)的gRPC连接。别只关注应用服务器端口,而把gRPC端口遗漏了。如果你把HTTP端口映射成了别的端口,那gRPC端口也要跟着调整——在Nacos的application.properties里可以配置grpc相关端口偏移量,但改动之前得先看清楚版本支持情况,Nacos的gRPC端口计算在不同版本里有变化,不要想当然。
5.3 配置文件找不到:启动路径变了
内嵌Tomcat启动时,工作目录基本固定,Nacos启动脚本里也通过路径拼接找到了conf/application.properties。换成保兰德后,Nacos作为部署应用运行,工作目录变成了应用服务器的启动目录,原来“相对路径”读配置文件的方式就会失效。
我当时遇到的报错是Nacos启动后读取不到数据库配置,默认跑成了Derby模式,日志里明确提示配置文件不存在。排查方法是查看启动后的实际配置项来源,把配置文件的绝对路径确认清楚,再去看保兰德部署应用时是否设置了正确的路径参数。更好的做法是:改造时就把配置文件定位改成绝对路径,或者通过环境变量/启动参数把配置目录显式传给应用,不要依赖默认的相对路径。
5.4 日志不输出或输出位置漂移
Nacos的日志默认写到logs目录,有start.out、nacos.log、config相关的日志文件。替换成保兰德后,这些日志的位置很可能变了。有些版本启动后日志到了应用服务器自己的logs目录下,有些版本因为logback配置里的相对路径失效,干脆不输出任何日志。
解决方式不复杂,但建议尽早处理:在启动参数里用-Dnacos.home指定Nacos的安装目录,再用-Dnacos.logs指定日志输出目录。同时把保兰德自身的日志和Nacos应用的日志分开,便于排查问题。如果发现日志乱成一团,排查效率会非常低,这一步别省。
5.5 集群模式下的隐藏问题
单机模式下Nacos好改也好验证,但集群模式会暴露更多问题。比如Nacos2.2.3以后的集群节点间同步用到了gRPC通信,如果你只把HTTP端口通过保兰德暴露,节点间的gRPC端口不通,服务注册信息就会出现分片——客户端连上A节点能看到服务,连上B节点却看不到,问题非常隐蔽。
另外一点是,应用服务器本身如果有会话保持或者负载均衡策略,部署在多节点时要小心。Nacos的密钥、身份认证等状态信息如果被应用服务器的会话机制干扰,用户在控制台的登录态可能不稳定。建议把保兰德与会话相关的配置改成不启用持久化会话,让Nacos控制台的登录态管理保持在应用内。
5.6 线程池和超时参数需要重新校准
应用服务器的线程池模型和默认参数跟内置Tomcat不同。替换后如果并发量上来了,可能出现请求排队严重、接口超时告警,这时候排查一下保兰德的线程池配置、连接超时参数。
尤其注意Nacos的配置中心场景:客户端长轮询拉配置时,HTTP连接会长时间挂起等待服务端响应,这种连接非常消耗线程。如果应用服务器的最大线程数配置得太小,遇到大量客户端同时拉配置时,线程池会被长轮询请求占满,导致注册中心的普通HTTP请求反而得不到处理。我当时的处理方式是专门为Nacos应用调大最大线程数,并设置合理的空闲超时时间,让长轮询连接和普通请求能共存。这块需要在压测环境上多做几轮验证,别直接上生产调参。
5.7 健康检查:监控和负载均衡策略的同步调整
改造完成后,负载均衡和后端的健康检查也要跟着改。以前Nacos的探活方式通常是检查8848端口的HTTP响应,改造后这个端口还是由保兰德监听,理论上探活路径不变。但如果保兰德默认的探活URL和应用实际的根路径不一致,负载均衡可能会一直把节点标记为不健康。
我们当时把后端健康检查URL改成了/nacos/v1/console/health/readiness这类Nacos自带的健康检查接口,并且确认返回码是200才视为健康。这个接口在保兰德接管后依然可用,因为请求最终会进入Nacos应用逻辑。另外,保兰德自己如果有多实例管理界面,节点是否激活和应用是否正常启动是两个概念,要区分清楚,不要把“保兰德进程活着”和“Nacos应用可用”当成一回事。
6. 替换后的运维经验和后续建议
改造落地不是终点,运维方式得跟上。我改造完成后的一个强烈感受是:原来一套启动脚本搞定的事情,现在要同时管理保兰德进程和Nacos应用两层,运维复杂度确实上升了。一个很实用的建议是,把Nacos应用在保兰德上的部署流程固化成脚本或自动化模板,避免每次节点扩容时人工点界面配置,省时省力还能减少误操作。
日常运维时,检查项也变了。除了Nacos自身的接口可用性,还要关注保兰德的JVM内存、线程池状况、应用部署状态,以及是否触发了类加载或安全策略方面的告警。我建议在监控平台里同时配置保兰德JVM指标和Nacos核心接口拨测,两个都绿才算这个节点真的健康。
最后分享一个体会:这种“把集成组件替换成独立中间件”的改造,本质不是技术难题,而是依赖管理和边界重构的问题。它的工作量绝大部分花在“让Nacos从一个简单的Spring Boot应用,变成一个能适应外置Servlet容器的标准Web应用”上。只要把类加载、路径、端口、配置来源这几个关键点控制住,整个过程就可以按部就班地推下去。如果你们团队正在做类似改造,建议先拿一个非核心的测试集群练手,跑通整套流程再碰生产,踩过的坑就不会变成事故。
