手头有个服务突然连不上,第一反应查防火墙,第二反应怀疑代码改挂了,折腾了大半天,最后发现就是一行报错:listen tcp 127.0.0.1:11434: bind: only one usage of each socket addre。端口被占了。这种问题在我这几年的网络调试里碰到过太多次——TCP和UDP这两个端到端传输协议,考试的时候人人都能默写出"TCP可靠、UDP不可靠",可真到线上排错、性能压测、工控联调的时候,这些基础概念才显出真正的分量。
这篇就把TCP和UDP从头到尾掰开揉碎讲一遍。不绕弯子,直接用实际场景说话:三次握手到底在握什么、四次挥手为什么是四次、拥塞控制是怎么让网络"既快又不崩溃"的、端口占用怎么排、iperf3怎么打UDP流、选型的时候到底该闭眼选TCP还是UDP。适合刚入门想建立完整认知的开发者,也适合被线上网络问题折磨过的运维和工控工程师。
1. "端到端"到底在端什么:传输层在协议栈里的真实位置
1.1 从主机到进程:IP只解决"送到哪台机器",传输层解决"交给哪个程序"
很多人背七层模型背得滚瓜烂熟,但真要问一句"传输层和网络层到底谁干活",容易卡壳。我习惯用快递来类比:IP协议解决的是"这个包裹从上海寄到北京",它关心的是城市、街道、楼栋,也就是IP地址。但包裹到了楼栋之后,收件人是谁?是302的王先生还是501的李女士?这个"具体交给谁"的问题,就是端口号在解决的。
一个IP地址加一个端口号,才构成一个完整的"端点"。而传输层做的事情,就是在这些端点之间建立逻辑通信通道。所以教科书上叫它"端到端"协议,这个"端"指的不是电脑,而是电脑上跑着的某个进程、某个服务。比如你同时开着浏览器(用着443端口)、挂着SSH(用着22端口)、跑着数据库(用着3306端口),数据包到了你机器这个IP之后,是靠TCP/UDP头里的端口号来分发的。
实际排查的时候,我们常说的"四元组"就是这套逻辑的具象化:源IP、源端口、目的IP、目的端口。TCP连接其实就是靠这个四元组来唯一标识的。你在netstat里看到的一行ESTABLISHED连接,背后就是一个四元组在维护着状态。
1.2 网络层"尽力而为",可靠性的活全在传输层
这里有个常被误解的点:IP协议是"尽力而为"的,它不保证不丢包、不保证顺序、不保证不重复。丢包了谁来管?乱序了谁来排?就是传输层。
TCP把"可靠"这件事扛了下来:确认机制、超时重传、序列号排序、滑动窗口限速,这是TCP的全部家当。UDP则选择"裸奔":我把数据报发出去,能不能到、什么时候到、对不对,我都不管,交给上层去处理。所以"端到端"这个词的另一层意思,就是复杂度和可靠性都在端系统上实现,网络中间的路由器、交换机只管转发,不承担TCP的状态维护。
理解了这点,你就能解释很多现象:为什么局域网内UDP延迟这么低,因为中间设备不维护连接状态,数据包进来就转发;为什么TCP在有线网络里表现稳定,因为它把可靠性都做在了两端。这也是为什么我们要单独学习传输层——它才是应用层和网络层之间的翻译官和质检员。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. TCP的可靠性,是拿三次握手换来的
2.1 三次握手:不只是"打招呼",是在互相确认序列号起点
面试必考的三次握手,很多人理解为"你好""你好""好的",这么说没错,但不够本质。三次握手真正干的事情,是同步双方的初始序列号(ISN)。
TCP是面向字节流的,每个字节都有一个序列号,接收方靠序列号来排序、去重、确认。如果两端不从同一个起点对齐,后面的数据传输全乱套。所以三次握手的过程实际上是:
- 客户端发送
SYN报文,初始序列号seq=x,同时表示"我要建立连接,我的起始序号是x"。 - 服务端回复
SYN+ACK,报文的seq=y,确认号ack=x+1,表示"收到你的x,我的起始序号是y"。 - 客户端再回一个
ACK,seq=x+1,ack=y+1,表示"收到你的y,连接建立"。
我见过很多人在理解上纠结"握手是三次还是两次",一个非常实用的判断标准:至少需要一来一回确认双方的收发能力,且要同步双向的ISN,两个方向各需要一次SYN交换,再加上对第一次SYN的确认,最少就是三次。两次握手最大的问题在于,如果客户端第一个SYN在网络里滞留超时重传,服务端可能会建立一个已经过期的旧连接,浪费资源。三次握手让双方都确认了"对方确实活着、序列号确实对上了",再开始传数据。
用Wireshark抓一次包就能看得非常清楚。我建议每个做网络开发的人都亲自抓一次:启动抓包,然后telnet或者nc连一个端口,看那三个包的seq/ack变化,比背十遍教科书都有效。
2.2 四次挥手:TCP是全双工的,断开也得两边分别说再见
握手要三次,挥手却要四次,很多人不理解。关键在于TCP连接是全双工的——数据可以同时双向流动。断开的时候,每一端都必须单独关闭自己的发送通道,所以整个断开过程是四个动作:
- 主动关闭方发送
FIN,seq=m,表示"我的数据发完了"。 - 被动关闭方回复
ACK,ack=m+1,表示"知道了,但我这边可能还有数据要发"。 - 被动关闭方发完剩余数据后,也发送
FIN,seq=n。 - 主动关闭方回复
ACK,ack=n+1,连接彻底关闭。
这里最容易出问题的状态有两个:CLOSE_WAIT和TIME_WAIT。
CLOSE_WAIT是被动关闭方在收到对方FIN之后,应用程序没有调用close()关闭socket导致的状态。如果你的服务器上有大量CLOSE_WAIT,基本可以断定是代码里没释放连接。这是应用层bug,不是协议问题。
TIME_WAIT是主动关闭方在发送最后一个ACK之后进入的状态,要持续2个MSL(报文最大生存时间,通常约1到4分钟)。为什么要有这个等待?两个原因:一是确保最后一个ACK能到达对端,如果丢了,对端会重发FIN,你还能再补一次ACK;二是让这个连接的四元组在网络中的所有旧报文都消失,避免新连接复用了相同四元组之后收到旧连接的数据。这个状态是TCP可靠性的设计选择,代价就是端口资源被占用一段时间。
我在做高并发短连接服务的时候,就遇到过大量的TIME_WAIT导致端口耗尽。后面第4章会专门讲怎么处理。
2.3 连接状态机:排查问题必须背下来的那张表
TCP连接的状态迁移不是只有"建立"和"断开"两个状态,中间还有SYN_SENT、SYN_RCVD、ESTABLISHED、FIN_WAIT_1、FIN_WAIT_2、CLOSE_WAIT、LAST_ACK、TIME_WAIT、CLOSED。排查的时候靠的就是这些状态对应的位置。
比如你用ss -natp看到一堆SYN_RCVD,说明服务端收到了SYN但没完成握手,可能是半连接队列满了,也可能是服务端应用卡死。看到一堆ESTABLISHED但业务超时,就得往应用层和网络质量上想。我在下面列了个常见状态速查表:
| 状态 | 含义 | 常见问题 |
|---|---|---|
| LISTEN | 服务端在监听端口 | 端口没监听说明服务没起来 |
| SYN_SENT | 客户端发了SYN,等回包 | 可能对方防火墙拦了SYN |
| SYN_RCVD | 服务端收到SYN,回SYN+ACK | 半连接队列满,SYN洪水 |
| ESTABLISHED | 连接建立,正常通信 | 连接数过多是另一个问题 |
| FIN_WAIT_1 | 主动发FIN,等ACK | 通常很快过去,卡住说明对端异常 |
| FIN_WAIT_2 | 收到ACK,等对方FIN | 对端不关连接会卡在这 |
| CLOSE_WAIT | 收到FIN,应用没close | 代码bug,必须查 |
| TIME_WAIT | 主动关闭方收尾状态 | 量大导致端口耗尽 |
| LAST_ACK | 被动关闭方发FIN等ACK | 通常在CLOSE_WAIT后面 |
我一般排查思路是:先ss -nat看状态分布,再strace或看应用日志,定位是协议层的问题还是应用层的问题。这个套路在后面第4章的实战里会展开。
3. 流量控制与拥塞控制:TCP为什么"又慢又快"
3.1 滑动窗口:接收方管住发送方的"令牌"
很多新人问:TCP既然靠ACK确认每一包,那性能岂不是取决于是"发一包等一包"?如果真这样,跨太平洋的TCP连接一秒也就发几包,速度惨不忍睹。TCP的解法是滑动窗口。
窗口大小的本质,是接收方告诉发送方"我还能收多少数据"。发送方在没收到ACK之前,最多发出去窗口大小那么多的数据。比如窗口是64KB,发送方可以连续发64KB的数据不用等ACK,收到一部分ACK之后窗口往前滑,继续发新的数据。这样网络链路就被填满了,而不是每包都停下来等确认。
窗口是接收方通过TCP头的Window字段通告给发送方的。如果接收方的应用读取速度跟不上,就会把窗口通告调小,甚至通告为0,逼着发送方暂停。这是TCP的"流量控制"——防止发送太快把接收方压垮。
实际调优的时候,经常提到一个概念叫带宽延迟积(BDP):网络带宽乘以往返时间(RTT),就是这个连接应该在途的数据量。如果窗口小于BDP,链路就吃不饱,吞吐量上不去。这就是为什么在跨地域、跨国的长肥链路(Long Fat Network)上需要调大窗口和启用窗口缩放选项,否则带宽哪怕有1Gbps,吞吐也只有几十Mbps。
3.2 拥塞控制:不是接收方管你,是网络管你
流量控制是接收方的"需求"驱动,拥塞控制则是发送方主动做的"供给侧限制"——因为网络内部的瓶颈没人告诉你,只能靠发送方自己探测。TCP的拥塞控制核心是维护一个拥塞窗口(cwnd),发送方实际能发的数据量是min(接收窗口, 拥塞窗口)。
拥塞控制现在主流的有四条算法,本质是一个"探测——撞墙——退让——恢复"的循环:
-
慢启动:连接刚建立时,cwnd从很小的值开始(现在通常是10个MSS),每收到一个ACK,cwnd翻倍。这是指数增长,增长过程非常快。但为了避免炸掉网络,有一个阈值
ssthresh。增长到ssthresh之后,进入拥塞避免阶段,变成每经过一个RTT增加1个MSS,线性增长。 -
拥塞避免:线性增长阶段,目的是在接近网络容量时慢慢试探,不要一下超过去。
-
快重传:如果发送方连续收到3个重复ACK,可以判断"丢包了",但不是傻等超时,而是立即重传丢失的包。这个设计让TCP在轻微丢包时不至于傻等重传超时。
-
快恢复:丢包之后,把
ssthresh降到当时cwnd的一半,cwnd直接降到新的ssthresh,然后进入拥塞避免阶段。旧式的TCP Tahoe在丢包后会把cwnd降到1重新慢启动,恢复太慢;Reno及之后的算法用快恢复,在轻微丢包下性能好很多。
现代实际系统里,Linux默认的TCP拥塞控制算法是cubic(在内核里可以通过sysctl net.ipv4.tcp_congestion_control查看),B站等大厂还在推bbr。BBR的思路跟传统算法完全不一样——它不再靠丢包来探测网络容量,而是靠实时测量带宽和RTT来建模,在有一定丢包的链路上表现很惊艳。我实测过在普通跨域网络上,BBR比cubic的吞吐能高出一大截。
3.3 实测TCP性能:iperf3怎么证明"链路到底快不快"
说再多理论,不如直接测。iperf3是我做网络性能验证时最常用的工具,不管是局域网打流还是跨云专线测试,都用它。
TCP打流很简单,服务端和客户端各装一个iperf3:
bash复制# 服务端
iperf3 -s -p 5201
# 客户端
iperf3 -c 192.168.1.100 -p 5201 -t 30
跑完会输出带宽、重传(Retr)次数和CWND曲线。如果带宽远低于预期,重点看重传次数:如果重传特别多,说明链路质量差或者有拥塞;如果重传很少但带宽上不去,大概率是窗口或BDP的问题,可以考虑试试BBR。
有个经常踩的坑:iperf3默认TCP是单线程,如果机器核心多、网卡是万兆,单线程压不满。这时候加-P 4或者-P 8,用多线程并发打流:
bash复制iperf3 -c 192.168.1.100 -p 5201 -t 30 -P 8
实际项目里,我见过很多"号称千兆专线,实际吞吐只有200Mbps"的案例,最后定位都是TCP窗口或中间设备限速,而不是带宽本身不够。TCP性能这个问题,真的值得花时间认真调一调。
4. 端口占用与连接状态:TCP实际排错实战
4.1 bind: only one usage of each socket addre 到底在说什么
文章开头提到的那个报错,是Go或者Python这类语言在创建监听socket时,如果端口已经被占用,会直接抛出来的一句话。翻译成人话就是:这个端口已经被另一个进程占用了,同一个IP地址和端口只能被一个socket监听。
排查这个问题的标准路径:
Windows下:
bash复制netstat -ano | findstr 11434
tasklist | findstr <PID>
taskkill /PID <PID> /F
Linux下:
bash复制ss -ltnp | grep 11434
# 或者
lsof -i:11434
kill -9 <PID>
报错的另一个常见原因,是服务退出后端口还处于TIME_WAIT状态。此时如果服务端代码设置了SO_REUSEADDR,一般能正常绑定;如果没设置,可能就会提示端口被占用。所以做TCP服务端开发,监听socket上设置SO_REUSEADDR几乎是标配——它的作用就是允许新socket绑定到TIME_WAIT状态的四元组,避免重启服务时被卡住。
在Go里这样写:
go复制ln, err := net.Listen("tcp", ":11434")
默认就带上了SO_REUSEADDR,所以Go一般不会遇到这个问题。Python的socket库就需要手动设置:
python复制s.setsockopt(socket.SOL_SOCKET, socket.SO_REUSEADDR, 1)
至于生产环境遇到端口被占,核心原则是别急着kill进程——先确认是谁占的,是不是另一个业务在监听,再决定处理方式。我之前就碰到过测试环境两个服务抢同一个6888端口,两个团队各管各的,最后只能改端口规划。
4.2 TIME_WAIT和CLOSE_WAIT:高并发服务的两大杀手
高并发短连接服务,最常见的两个状态异常。
大量TIME_WAIT:比如Nginx代理、RPC调用方这类角色,每次请求都主动断开连接。如果QPS高,TIME_WAIT会快速堆积。默认2MSL(Linux上大约60秒)之后才释放,在连接数几十万的机器上,端口号只有6万多个(实际上本地端口范围默认32768-60999),很快会耗尽,导致新连接没有可用端口。
常见解决手段:
- 调大本地端口范围:
sysctl net.ipv4.ip_local_port_range='1024 65535'。 - 开启
net.ipv4.tcp_tw_reuse=1,让内核在安全条件下复用TIME_WAIT状态的连接(只对主动发起的连接有效,且需要开启时间戳选项)。 - 如果是服务端主动关闭导致的TIME_WAIT,优先考虑业务上能不能改成客户端主动关闭。
大量CLOSE_WAIT:这基本是应用代码bug,原因是对端发了FIN,但你的进程没有调用close释放socket。常见的出问题点是Java、Go里的连接池没关、响应流没读完就返回、异常分支里忘记关闭连接。排查方式只有一个:找出持有这些连接的是哪个进程,抓线程栈,看卡在哪个业务逻辑里。
4.3 能ping通但TCP连接失败?逐层剥到根因
热搜词里有句话很典型:"modbus tcp 能ping通,但mod scan不通什么原因"。这种"网络通但业务不通"的问题,排错思路应该是从下往上,一层层剥:
- 物理层/网络层:ping通说明IP层没问题,双方在同一网络或路由可达。
- 端口可达性:在客户端机器上用
telnet <ip> 502或者nc -zv <ip> 502测一下TCP端口通不通。如果这步失败,重点查服务器防火墙(iptables/firewalld)、云安全组、中间交换机ACL。 - 服务监听状态:在服务器本机看
ss -ltnp | grep 502,确认服务进程确实在监听这个端口,而不是服务半死不活。 - 应用层协议:端口通了但Modbus扫描不通,可能是Modbus从站的从站地址(Unit ID)不对、功能码不被支持、数据寄存器地址越界,或者从站只支持特定波特率(串口网关场景)。
这个排查链路我几乎每次都能用上。很多"软件工程师觉得是网络问题"的case,最后定位在应用协议配置上;很多"觉得是程序问题"的case,最后是防火墙拦了端口。别猜,拿工具一层层验证。
5. UDP:无连接不是缺陷,而是特性
5.1 UDP报文结构:轻量到几乎"裸奔"
UDP的头部只有8个字节:源端口(16位)、目的端口(16位)、长度(16位)、校验和(16位)。对比一下,TCP头最小是20字节,加上选项可以到60字节。UDP没有序列号、没有确认号、没有窗口、没有标志位。它就是把应用层的数据报扣上一个8字节的头,直接扔给IP层发出去。
这带来几个特性:无连接(不需要握手,想发就发)、无确认(发了不知道对方收到没)、无重传(丢了就丢了)、无排序(后发可能先到)。"不可靠"三个字,全部都在这。
但它也因此拿到了两大优势:低延迟和开销小。TCP需要握手建立连接,UDP不需要;TCP需要维护连接状态,UDP不需要;TCP有拥塞控制可能会主动降速,UDP没有,想发多快发多快。在实时性敏感、容忍丢失的场景下,这些优势是压倒性的。
5.2 UDP的真实应用场景:远比你想的多
很多人觉得UDP是个"小透明"协议,但实际上互联网上有大量的流量走的是UDP:
- DNS查询:默认走UDP的53端口,查域名就是发一个UDP包等一个UDP响应,快且简单。只有响应太大才会切换到TCP。
- DHCP:客户端没有IP地址,只能广播发DHCP Discover,广播天然适合UDP。
- 音视频流:语音视频通话、直播、视频会议走RTP,RTP底层就是UDP。原因是音视频可以容忍丢包(丢几帧无所谓),但不能容忍重传延迟(你绝对不能等一个迟到的话音帧)。
- 游戏同步:多人游戏的位置同步信息,用UDP——丢一帧位置可以插值,但等重传会导致瞬间卡顿。
- 物联网/工业上报:传感器数据周期性上报,丢一个周期下个周期又来了,UDP够用。
我在嵌入式领域经常看到UDP,比如用LabVIEW做上位机跟下位机通信,很多人就会问我"LabVIEW怎么用UDP"。LabVIEW里就是UDP Open、UDP Write、UDP Read、UDP Close这几个VI,比TCP的流程简单太多,不需要处理连接建立、断线重连。CODESYS、汇川PLC这类工业控制平台里,UDP还被用来做实时状态交互,因为PLC的扫描周期是毫秒级,TCP三次握手那点延迟在高速控制场景下根本不可接受。
热搜词里还有"wsl2的ubuntu与window的udp通讯",这个我实际也折腾过。WSL2默认是NAT网络,Windows宿主机跟WSL2里跑的服务,UDP互通有个典型的坑:WSL2的IP是虚拟NAT网段,从Windows访问WSL2的UDP端口需要看具体版本,从WSL2访问Windows反而简单,直接用Windows宿主机的IP就行。如果要在局域网其他机器访问WSL2里的UDP服务,要么配置端口转发,要么把WSL2的网络模式改成镜像模式——2.0版本以后可以在.wslconfig里设置networkingMode=mirrored,能省去不少麻烦。
5.3 UDP打流与性能测试:iperf3的UDP模式
UDP性能测试同样可以用iperf3,而且UDP模式下能看到几个非常有用的指标:带宽、抖动(Jitter)和丢包率(Lost/Total Datagrams)。
服务端:
bash复制iperf3 -s -p 5201
客户端:
bash复制iperf3 -c 192.168.1.100 -p 5201 -u -b 100M -t 30
这里的-u表示UDP,-b 100M表示以100Mbps的速率发包,-t 30表示持续30秒。跑完结果里重点看:
Jitter:延迟抖动,单位ms。小于1ms说明链路非常稳,超过5ms在音视频通话里就能感觉到卡顿。Lost/Total Datagrams:丢包率。如果丢了5%以上,音视频质量会明显劣化。- 实际带宽和
-b的设置是否匹配:如果实际带宽到不了设定值,说明链路瓶颈顶住了。
还有一个经验:做UDP打流的时候,先从小带宽开始(比如-b 10M),慢慢往上调,找到链路能承受的最高速率和丢包拐点。一上来就-b 1000M,可能直接把中间设备打崩,或者被运营商限流,测出来的数据没有参考意义。
6. TCP还是UDP:选型不只是"可靠vs不可靠"
6.1 选型判断框架:先回答五个问题
很多人纠结TCP还是UDP,我的建议是别问"哪个好",而是问自己五个问题:
- 数据丢了,业务能容忍吗? 文件传输、交易请求、指令下发——丢一条就是事故,选TCP。位置坐标、传感器读数、语音帧——丢一两个影响不大,UDP可行。
- 延迟敏感吗? 交互式音视频、实时控制、游戏——TCP的重传和队头阻塞可能比丢包还致命,选UDP。异步任务、后台同步——TCP的可靠值得等待。
- 通信场景是一对一还是一对多? 广播、组播只有UDP支持。TCP是纯单播协议。如果要做群发、设备发现(比如局域网广播找设备),UDP几乎是唯一选择。
- 连接数多大? 高并发服务器上,维护海量TCP连接的状态、内存、文件描述符是有成本的。UDP无连接,服务器只管收发,状态全部交给应用层,能支撑的连接规模大得多。
- 你能接受在应用层实现可靠性吗? UDP丢了包如果还想"可靠",就得自己在应用层加超时重传、序列号、去重、排序。这工作量不小,除非有现成框架,否则从零做一套可靠UDP是件大工程。
把这些问题过一遍,大部分场景其實答案已经确定了。下面这张总表可以直接抄:
| 维度 | TCP | UDP |
|---|---|---|
| 连接状态 | 面向连接,需要握手 | 无连接,即发即走 |
| 可靠性 | 确认、重传、排序 | 无确认、无重传、无排序 |
| 有序性 | 按序交付 | 可能乱序 |
| 传输方式 | 字节流 | 数据报(有边界) |
| 速度/延迟 | 握手开销大,队头阻塞 | 低延迟,无队头阻塞 |
| 流量控制 | 有(滑窗) | 无 |
| 拥塞控制 | 有 | 无 |
| 广播/组播 | 不支持 | 支持 |
| 典型应用 | HTTP、文件、数据库、Modbus TCP | DNS、音视频、游戏、IoT上报 |
6.2 QUIC、RUDP和"UDP之上的可靠传输"
中间有一类场景很微妙:既要低延迟,又要可靠性。比如谷歌的Chrome浏览器访问网站,看视频、玩游戏,如果直接走TCP,遇上丢包就要等重传,很容易卡顿;如果走纯UDP,数据不完整页面显示不出来。
QUIC就是拿UDP做底子,在应用层重新实现了可靠传输、拥塞控制、连接迁移等能力。现在HTTP/3就是基于QUIC的,它站在UDP的肩膀上,却提供了远超传统TCP的体验。核心原因是QUIC把控制权从操作系统内核挪到了用户态,可以快速迭代算法,还能避免TCP的头阻塞问题。
类似的还有游戏领域常用的KCP、RUDP。我的观点是:"到底选TCP还是选UDP",在2025年的现在,第三个选项是"基于UDP实现可靠传输"。如果你清楚自己的业务需要低延迟和可靠性兼顾,而且有R&D投入,这可以是一条非常不错的路。
6.3 工控场景实例:为什么Modbus TCP走TCP,ROS2却走UDP
工控和机器人领域,TCP和UDP的选择极其典型,我最后聊两个具体例子。
Modbus TCP协议,从名字就知道是走TCP。Modbus是请求-响应式的,一问一答,答不上来整个控制逻辑就得卡住。它天生需要可靠的上下行通信,而且每次交互是重操作,握手开销摊薄后完全可忽略。所以尽管Modbus TCP的报文结构极其简单,它依然坚定地坐在TCP之上。前面提到的"能ping通但mod scan不通"就是要沿着TCP链路排查,而不是UDP排查思路。
再看热搜词里问的"机器人ROS分发协议是udp吗"。ROS1默认走的是TCP(XMLRPC和TCPROS),ROS2改成走UDP(DDS的RTPS协议)。为什么ROS2要转向UDP?因为机器人是多节点、多话题的实时系统,一个话题消息发给多个订阅者,UDP天然支持组播;而且机器人场景里传感器消息更新频率极高,旧数据被新数据覆盖也没关系,UDP的时效性优势更贴合需求。当然,DDS在UDP之上加了服务质量策略(QoS),可以实现"可靠传输"的语义——如果你设置了RELIABLE的QoS,DDS会自己处理重传和确认。所以严格讲,ROS2是"UDP基础+应用层可靠性",这也是为什么我要强调选型别只看传输层名字,要看清整个协议栈。
还有个热搜词案例也值得一提:"西门子TCP只有每次重启的时候才能连上一分钟"。这种"能连上但很快断开"的典型原因通常是:PLC侧连接资源没释放(PLC作为服务器,连接的客户端异常断开但PLC没有及时清理)、通信超时设置太短、或者上位机在断开后没走完TCP的挥手流程导致PLC认为连接还在占用。这种问题在工控场景里特别容易遇到,排查的时候看PLC侧和上位机侧同时抓包,看是FIN/RST是谁先发的,基本就能定位到是哪边的连接管理逻辑出了问题。
最后说点个人的实际体会
写这么多,最想分享的一条经验是:TCP和UDP从来不是"二选一"的好与坏,而是"拿什么换什么"的成本账。TCP用握手和确认换可靠,UDP用裸奔换速度和灵活。我在实际项目里犯过最大的错误,是凭"TCP好可靠"就全上了TCP,结果在弱网高延迟的物联网环境里,重传风暴把带宽打满,设备全部掉线。后来改成UDP加应用层轻量确认,问题立刻缓解。相反,有同事做音视频,为了"不出错"走TCP,画面一丢包就卡成PPT,换成UDP+RTP之后流畅多了。
这个领域没有银弹,只有真正理解协议的设计边界,才能在你的场景里做出对的选择。建议每个做网络相关开发的朋友,都亲手用Wireshark抓一次完整的TCP握手挥手包,再用iperf3给自己的服务做一次打流测试,比读一百篇教程都管用。这套玩法,我用它在生产环境里救过很多次急,希望也能帮到你。
