1. 项目概述与整体设计思路
1.1 为什么现在还有人折腾RIP
先别急着关页面,我知道你心里在想什么:RIP这种上世纪八十年代的老古董协议,在OSPF、IS-IS、BGP遍地走的今天还有什么好聊的?但我跟你说,这个想法本身就是最大的误区。
我见过太多刚入行的网络工程师,一上来就抱着OSPF啃,LSA类型背得滚瓜烂熟,区域规划讲得头头是道,结果一进真实项目现场就懵了。为什么?因为很多企业内网、教育网、甚至运营商的接入层,至今还在跑着RIP。虽然新部署的网络几乎不会再选RIP,但存量网络的维护、割接、升级,全都要跟它打交道。更重要的是,RIP是理解动态路由协议的最佳入门教材——它把路由发现的底层逻辑完整地暴露给你看,没有OSPF那么多抽象概念,让你能用最具体的直觉去理解“路由协议到底在干什么”。
这篇文章我想从一个实操者的角度,把RIP从原理到配置、从验证到排障全部过一遍。你不需要有任何动态路由的基础,只要会配静态路由、知道路由表长什么样,就能跟着一步步搭起来。咱们用GNS3或者EVE-NG模拟器,三台路由器就能完整复现RIP的核心机制。
这篇文章能帮你解决什么问题?三个:搞清楚RIP的工作机制和防环设计,掌握RIPv2的配置命令和验证手段,学会在实际网络中排查RIP故障。如果你正在备考认证、或者在真实项目里遇到了RIP相关的网络问题,这篇文章应该能给你省不少时间。
1.2 RIP在动态路由协议家族中的定位
把路由协议画成一张图,RIP所在位置其实是很有代表性的。按工作范围分,RIP属于内部网关协议(IGP),只在一个自治系统内部工作;按算法类型分,它属于距离矢量协议,靠的是“听说”而不是“计算”——每台路由器不掌握全网的拓扑,只知道“到某个网段有多远,从哪个接口出去”,然后把这份认知告诉邻居。
这个“距离矢量”的名字起得特别直白,路由条目本质就是一个二维向量:方向(从哪个接口转发)加上距离(还有多少跳)。RIP的“距离”用跳数来计量,每经过一台路由器加1,最大有效跳数是15跳,16跳就被认定为不可达。这就是RIP最核心的边界——设计上就决定了它只能用在中小型网络里,网络直径一旦超过15台路由器,后续的路径就全部“消失”了。
拿OSPF和RIP做个对比你就有感觉了。OSPF是链路状态协议,每台路由器都维护一份完整的地图,然后用SPF算法自己算最短路径;RIP则像信息在人群中一传十、十传百,每个人只知道邻居告诉自己的话。OSPF收敛快、无跳数限制、支持分层设计,但配置和排障复杂度也上来了。RIP配置简单、实现门槛低、对设备性能几乎没要求,代价就是收敛慢、容易产生环路、网络规模受限。
那什么时候该用RIP?实话实说,新项目里RIP几乎没有主场。但在这么几种场景下,你依然要面对它:老旧网络利旧改造、某些特殊行业的规范化要求、还有学习阶段的模拟环境。更重要的是,RIP里那些防环思路——水平分割、毒性逆转、触发更新——在整个路由协议体系里都是通用的底层逻辑,学透了RIP,你再去学EIGRP和BGP,会发现很多概念其实是相通的。
1.3 核心需求拆解:从原理到配置到底要掌握什么
把“动态路由RIP”这个主题拆开来看,我觉得要想真正掌握它,有四个层次的东西绕不开,缺一个都会让你在实际操作里出问题。
第一层是工作流程。RIP启动后,先把直连路由放进自己的路由表,然后主动向邻居发送路由更新(RIPv2默认每30秒一次),告诉邻居“我这里有这些网段”。邻居收到更新后,把跳数加1,对比自己路由表里已有的条目——如果这条路由之前没有,就学习过来;如果已有但新路径更短,就替换;如果已有且新路径更长,怎么处理要看具体情况,这就是后面要聊的防环机制。这个过程循环往复,最终全网每台路由器都学习到所有网段的路由。
第二层是协议细节。RIP用UDP 520端口承载报文。RIPv1报文里不带掩码信息,意味着它无法支持可变长子网掩码(VLSM)和路由汇总,这直接导致了RIPv1在现代网络里几乎没有实用价值。RIPv2则加入了子网掩码字段、下一跳字段,还支持认证和路由汇总。所以咱们做配置实验,一律直接用RIPv2,这既是习惯也是规范。
第三层是配置命令。RIP的配置命令大概是所有动态路由协议里最简单的了,核心就三条:启动进程、选择版本、宣告网段。但“宣告网段”这个动作背后有个特别容易出错的理解点——RIP里的network命令不是告诉你“把这条路由发给别人”,而是“从哪些接口上参与RIP、把哪些直连网段放进RIP更新里”。这个逻辑没搞明白,后面配置一多必出错。
第四层是验证与排障。光会敲命令不算会,还要能通过show命令确认协议真的在正常工作,通过debug抓到更新报文,通过抓包看到RIP协议的真实交互过程。这一层是最能拉开新手和老手差距的地方。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. RIP核心原理解析与技术细节
2.1 RIP的三类报文和四组计时器
RIP的协议机制如果展开讲能写一本书,但对于实操来说,抓住“三类报文”和“四组计时器”就足够应付绝大多数场景了。
三类报文分别是Request报文、Response报文、还有RIPv2新增的Triggered Update报文。Request报文用于路由器启动时请求邻居发送完整的路由表;Response报文就是携带路由更新的报文,既包含对Request的应答,也包括周期性的主动通告;Triggered Update则是当路由信息发生变化时立即发送的更新,不用等30秒周期。RIPv2的Response报文可以携带多达25条路由条目,如果一个网段的路由超过25条,会分多个报文发送。
四组计时器是RIP稳定运行的核心,我做了个表,方便你对照理解:
| 计时器名称 | 默认值 | 作用 | 超时后果 |
|---|---|---|---|
| 更新计时器(Update) | 30秒 | 周期性发送路由更新 | 无(周期性行为) |
| 失效计时器(Invalid) | 180秒 | 标记路由不可达 | 路由标记为possibly down,等待删除 |
| 抑制计时器(Holddown) | 180秒 | 抑制可能环路的路径信息 | 期间不轻易接受更差路由 |
| 刷新计时器(Flush) | 240秒 | 从路由表中彻底删除路由 | 路由被永久删除 |
这个计时器组合在设计上非常巧妙,值得细品。想象一个场景:路由器A和B是邻居,A每隔30秒向B发送更新。某一天A突然宕机了,B怎么知道A出问题了呢?B的更新计时器不会因为A宕机而停止,仍然每30秒想发送更新,但它收不到A的回应,于是B开始数时间。180秒后,B把从A学到的路由标记为“不可达”,但不会立刻删除——这可能是一场临时故障,立即移除路由可能导致路由振荡。再等60秒,到240秒时如果仍然没收到A的更新,B才把这条路由彻底删除。
这里有个细节我特别提醒:实际中如果心跳连续丢失6次(180秒除以30秒),RIP就判定邻居失效,这个逻辑和我们日常用的BFD检测完全是两回事——RIP的收敛速度天然被这个超时机制拖慢了,所以在这段时间内,网络会出现路由黑洞或者依赖其他路径兜底的情况。这也是RIP在真实生产中被换掉的主要原因之一。
2.2 跳数度量与16跳不可达的设计哲学
RIP选择跳数(Hop Count)作为度量值,这个选择在协议设计史上是个有意思的话题。跳数只关心设备数量,不关心链路质量、带宽、延迟,这意味着RIP永远无法做到“最优路径选择”——它只能找到跳数最少的路径,哪怕这条路径是条56K的拨号线路,而另一条跳数+1的路径是万兆光纤。
给你举个例子。假设网络里有两条路可以到达同一个目标网段:路径一经过2台路由器,但中间是低速广域网链路;路径二经过3台路由器,全程都在千兆局域网上。RIP会毫不犹豫地选择路径一,因为它的跳数更小。而OSPF会综合带宽计算开销值,得出路径二更好的结论。这就是为什么RIP只能用在“对路径质量不敏感”的小网络里。
跳数上限15、16跳即不可达的设计,同样值得琢磨。为什么是15而不是更小或更大?因为在RIP的年代,网络规模普遍不大,15跳已经能覆盖绝大多数企业网络;同时,跳数上限的存在本身就是一种防环手段——一条路由如果被环路反复传播,跳数会不断累加,到了16跳就被判定不可达,从而终止环路传播。
从实操层面讲,这个16跳机制带来了一个非常具体的问题:当某条路由因为环路被累加到16跳时,你在路由表里看到的不是一条正常的路径,而是一条状态为“possibly down”的无效路由。很多新手看到路由表里出现这样的条目,第一反应是“路由消失了”,实际上它是被协议标记为不可达了。排查的时候看到这类状态,你应该立刻想到:链路上很可能是出现了环路或者路由震荡。
2.3 RIPv1与RIPv2的差异:现代网络为什么只认v2
RIPv1是1988年随RFC 1058发布的,RIPv2则是1994年由RFC 2453定义的。它们之间最本质的差别就一句话:v1是有类路由协议,v2是无类路由协议。这个差别带来的实际影响体现在下面几个方面。
RIPv1的报文格式里没有子网掩码字段,它只能根据IP地址的主类(A类、B类、C类)来判断网段边界,所以它无法支持可变长子网掩码(VLSM)和CIDR。这意味着在RIPv1的网络里,你不能把一个B类地址段划分成多个不同掩码的子网并在RIP里传播,否则路由器会把所有子网都当成同一个主类网络来看待。这个限制在IP地址资源紧张的今天几乎是致命的。
RIPv2则在报文格式上做了重要改进:每一条路由条目都携带了子网掩码字段,同时增加了下一跳字段,支持路由聚合和CIDR,还支持明文或MD5认证。认证这个功能在真实网络中相当有用——避免非法路由器接入网络后伪造路由信息,实施中间人攻击或者流量劫持。
还有一个在实际配置里经常遇到的情况:RIPv2默认开启自动汇总(auto-summary),它会把子网路由汇总成主类网络发送给邻居。这在某些场景下会造成路由黑洞——例如你有两个接口分别连接了172.16.1.0/24和172.16.2.0/24,如果不关掉自动汇总,RIPv2发送给邻居的可能只有一条172.16.0.0/16,邻居把去往这两个子网的流量都发过来,而你的路由器收到后还要再查一次路由表做二次转发,多一跳不说,如果路由表不完整就会丢包。所以基础配置里我通常会顺手敲一条no auto-summary,这是经验之谈。
2.4 防环机制:水平分割、毒性逆转、触发更新和抑制计时器
距离矢量协议的天然敌人是路由环路。RIP为了对抗环路,设计了四层防护机制,这四层机制可以说是整个距离矢量协议家族的思想基石,值得你花时间好好理解。
水平分割(Split Horizon)的逻辑最简单:从某个接口学到的路由,不能再从这个接口通告回去。道理很直白——邻居告诉你“到X网段往那边走”,你肯定不会反过来说“到X网段往你这边走”。如果没有水平分割,路由信息就会在相邻路由器之间来回反射,形成环路和不必要的路由振荡。实际配置中,水平分割默认是开启的,正常情况下不需要你干预,但如果你在串行链路或者帧中继网络上做实验发现路由不正常,可以考虑是不是水平分割在某些特殊接口类型下出现了问题。
毒性逆转(Poison Reverse)可以看作是水平分割的强化版:不只是不再通告回学到的接口,而是直接通告一条跳数为16的毒化路由,“告诉邻居这个网段不可达”。这样能让坏消息传播得更快,避免网络里其他路由器继续使用已经失效的路径。RIPv2的触发更新报文中毒化路由的出现频率很高,抓包时你会看到跳数16的条目,这就是在行使毒性逆转。
触发更新(Triggered Update)解决的是收敛速度问题。RIP默认30秒才发一次更新,如果网络拓扑发生变化了也要等这么久,那故障恢复时间就太长了。有了触发更新机制,当路由发生变化时立即发送更新,不用等待周期计时器。在真实网络里,这个机制能显著缩短路由收敛时间,是RIP为数不多的“响应敏捷”的地方。
抑制计时器(Holddown Timer)是一道保险丝,它的作用原理是:当一条路由被判为不可达后,开启一个抑制周期,在这个周期内即使收到来自其他邻居的、跳数更大的替换路由,也不会采纳。为什么要这么做?因为一条路由失效后,很可能是通过网络拓扑的某些中间节点传过来的信息,这些信息未必准确,如果立刻采纳可能导致环路。等待抑制计时器超时,让网络状态稳定下来,再接受新的路由信息,更安全。这四个机制协同工作,才让RIP在简单网络里能做到自愈。
3. 实战配置:RIP路由协议从零到通
3.1 实验环境准备与拓扑设计
咱们用GNS3模拟器来做这个实验,真实设备上命令完全一致,模拟器里练习成本低、快照方便,适合反复折腾。需要准备三台路由器,我用的是思科IOS镜像,型号选择c7200或者c3745都可以,只要支持RIPv2就行。设备之间用两条链路互联,但注意不要让拓扑成环——我们先做最基础的链状结构,后面探讨环状拓扑时再加链路。
拓扑规划如下:
code复制R1 --- R2 --- R3
三个路由器构成了一个两跳的链状网络,这个拓扑虽然简单,但足够演示RIP的核心机制了。地址规划是这样的:
| 设备 | 接口 | IP地址 | 所属网段 |
|---|---|---|---|
| R1 | G0/0 | 192.168.12.1/24 | 192.168.12.0/24 |
| R2 | G0/0 | 192.168.12.2/24 | 192.168.12.0/24 |
| R2 | G0/1 | 192.168.23.2/24 | 192.168.23.0/24 |
| R3 | G0/1 | 192.168.23.3/24 | 192.168.23.0/24 |
另外每台路由器上再设置一个环回接口,模拟终端网段。R1加一个Loopback 0,地址为10.0.1.1/24,R3加一个Loopback 0,地址为10.0.3.3/24。为什么要加环回口?因为环回接口永远处于up状态,用它模拟一个网段比真实接一台PC更稳定,跑实验可靠性更高,后面验证跨网段路由学习时会非常直观。
接口IP配置我就不逐条写了,基础操作,记住一个原则:先配接口IP,再起路由协议,顺序不要反。如果你先敲了router rip再配接口地址,RIP不会自动把后来配的地址宣告进去,需要再检查一遍network命令是否覆盖了所有直连网段——这个坑我踩过好多次,后面会细说。
3.2 一步一步在R1、R2、R3上启用RIPv2
现在我们从R1开始配置RIP。进入全局配置模式,依次执行下面这些命令:
code复制R1(config)# router rip
R1(config-router)# version 2
R1(config-router)# no auto-summary
R1(config-router)# network 192.168.12.0
R1(config-router)# network 10.0.0.0
R1(config-router)# exit
拆解一下这几条命令的含义。router rip启动了RIP进程,这是所有配置的前提。version 2把协议版本切到RIPv2,如果不敲这一句,设备默认会同时收发v1和v2的报文,虽然看起来“兼容性更好”,实际上会让路由更新的行为变得不可控,我在前面的原理部分讲过v1和v2的差异,这里一定要显式指定版本。
no auto-summary关闭自动汇总,这条命令的重要性我前面提过,不再赘述,你在生产环境里给RIP做配置时最好也养成这个习惯。
两条network命令是整个配置里最需要理解的地方。network 192.168.12.0的意思是:在属于192.168.12.0/24这个网段的所有接口上启用RIP,并且把该网段作为直连路由通告给邻居。同理,network 10.0.0.0作用于Loopback 0所在的10.0.1.0/24网段。注意,network后面跟的可以是一个主类网络号,也可以写子网号,RIPv2支持无类通告,但很多老的教材还在用主类写法,容易让人困惑。我建议你直接写具体网段,表达意图更明确。
R2在R1的基础上多了一条链路,命令如下:
code复制R2(config)# router rip
R2(config-router)# version 2
R2(config-router)# no auto-summary
R2(config-router)# network 192.168.12.0
R2(config-router)# network 192.168.23.0
R2(config-router)# exit
R3的配置逻辑和R1对称,就是把自己的直连网段宣告进RIP:
code复制R3(config)# router rip
R3(config-router)# version 2
R3(config-router)# no auto-summary
R3(config-router)# network 192.168.23.0
R3(config-router)# network 10.0.0.0
R3(config-router)# exit
配置完成后,理论上等几秒钟,RIP的初始更新就发出去了,链路两端的路由器互相学习到路由。但理论归理论,实践中经常会出现配完了却学不到路由的情况,你先别急着往下走,停下来用下面的验证命令确认一下:
code复制R1# show ip rip database
R2# show ip route rip
R3# show ip route rip
如果一切正常,R1上应该能看到去往192.168.23.0/24和10.0.3.0/24的路由,其中去往10.0.3.0/24的下一跳是192.168.12.2;R3上能看到去往192.168.12.0/24和10.0.1.0/24的路由。如果看不到,多半是network命令漏了网段、或者接口没起来、再或者两端的协议版本不一致——这些你都可以对照后面的故障排查章节来定位。
3.3 验证RIP路由表:show命令的正确打开方式
配置完成不等于结束,真正的技术活在于验证,在于能通过命令输出判断网络到底健不健康。我来带你逐条过一遍最常用的验证命令。
先看R1的路由表。执行show ip route rip,输出里只会显示通过RIP学习到的路由,排除直连和静态路由的干扰,这是快速判断RIP是否生效的最直接方式。正常状态下,你应该看到两条以R开头的路由:
code复制R 192.168.23.0/24 [120/1] via 192.168.12.2, 00:00:08, GigabitEthernet0/0
R 10.0.3.0/24 [120/1] via 192.168.12.2, 00:00:08, GigabitEthernet0/0
注意方括号里的[120/1],120是RIP的管理距离,1是度量值(跳数)。R1到R3的环回网段要经过R2一台设备,所以跳数是1。这个数字会随着网络拓扑变化而调整,排查路由选择问题时,盯住度量值的变化绝对是第一手线索。
再看show ip rip database,这条命令展示的是RIP协议的数据库,比路由表更底层。它的输出里会明确标出每条路由的来源是接口还是远程学习,还会显示过期时间。我建议你把它和show ip route配合着看,能更完整地把握RIP的工作过程。
如果想看RIP到底是怎么和邻居交互的,可以开debug。debug ip rip会在控制台实时打印RIP的收发更新报文。举一个实际输出片段:
code复制RIP: sending v2 update to 224.0.0.9 via GigabitEthernet0/0 (192.168.12.1)
RIP: build update entries
192.168.12.0/24 via 0.0.0.0, metric 1
10.0.1.0/24 via 0.0.0.0, metric 1
RIP: received v2 update from 192.168.12.2 on GigabitEthernet0/0
192.168.23.0/24 via 0.0.0.0, metric 1
10.0.3.0/24 via 0.0.0.0, metric 1
注意RIP的组播地址224.0.0.9,这是RIPv2专用的组播地址,RIPv1用的是广播地址255.255.255.255。从debug输出里你能直观地看到“发更新、收更新”的全过程。看完之后务必记得执行undebug all关掉debug,否则设备在高负载下会直接被日志刷死,这是运维大忌。
3.4 高级配置:被动接口、默认路由与手工汇总
基础RIP配置能让网络跑通,但在真实部署里你还需要掌握几个“进阶技能”,它们能让你少惹很多麻烦。
第一个是被动接口(Passive Interface)。RIP默认会在所有启用了RIP的接口上发送组播更新。但在某些连接终端的接口上,根本没有其他路由器存在,发送RIP更新纯属浪费带宽,还可能让终端主机意外收到路由协议报文。正确的做法是把这些接口配置为被动接口,让路由器只接收不发送RIP更新。命令很简单:
code复制R1(config)# router rip
R1(config-router)# passive-interface loopback 0
我在连接PC的接口上经常会这么干。配置完成后可以用show ip rip interface确认接口状态,输出里会显示接口被标记为passive。
第二个是默认路由下发。有些场景下,你可能希望RIP网络里的所有路由器都能知道“去外部网络走边界路由器”,最简单的方式就是在边界路由器上用default-information originate命令,让RIP把默认路由(0.0.0.0/0)通告给邻居。配置在边界路由器上:
code复制R1(config)# router rip
R1(config-router)# default-information originate
前提是边界路由器上已经有一条默认路由(可以是静态配置的,也可以是其他协议学来的),否则这条命令不会生效。在实验里我会在R1上配一条静态默认路由指向运营商网关,然后通过RIP把它下发到R2和R3。
第三个是手工路由汇总。RIP默认的自动汇总在无类网络里经常造成路由黑洞,所以我们会关掉它,然后按需做手工汇总。比如R3上有多个连续的Loopback网段10.0.0.0/24、10.0.1.0/24、10.0.2.0/24,想汇总成10.0.0.0/22通告出去,可以在接口模式下手工指定汇总:
code复制R3(config)# interface GigabitEthernet0/1
R3(config-if)# ip summary-address rip 10.0.0.0 255.255.252.0
配置汇总后,R1和R2的路由表里只有一条10.0.0.0/22,而不是三条明细路由。这样做的好处是减少路由表条目、降低更新报文大小、同时能在一定程度上隔离路由振荡。但手工汇总有个前提:被汇总的网段必须是连续的且能在指定掩码下归并,否则会造成路由黑洞,到时候就是典型“通一半”的网络故障。
3.5 抓包分析:透视RIP报文的真实面貌
到了这一步,你已经能把RIP配置跑通、通过命令验证了。再往前一步,我建议你用Wireshark抓一次包,亲眼看看RIP报文长什么样,这比背十遍协议规范都管用。
在GNS3里,右键R1和R2之间的链路,选择Start capture,然后Wireshark会自动弹出。这时候在R1上敲clear ip route *或者重启RIP进程(shutdown/interfaces、再no shutdown),就能立刻触发路由更新,Wireshark里马上会看到从192.168.12.1发往224.0.0.9的UDP报文,端口520。
点开一个响应报文,重点关注这几个字段:Command字段值2表示Response,Version字段显示2,说明是RIPv2。往下翻到Route Tag和Address Family Identifier,AFI值为2表示IP协议。然后你会看到多个路由条目,每个条目包含IP地址、子网掩码、下一跳、Metric字段。此时你会真正理解RIPv2报文为什么能支持VLSM——因为掩码字段确实被写进了报文里,这在RIPv1的报文里根本不存在。
还有一个细节值得留意:Metric字段。你可能会看到某条路由的Metric显示为16,这就是毒性逆转在发挥作用。当R2从R1的某个接口学到路由后,它不会原样把这条路由通告回去,而是置为16(不可达)再发给R1,明确表示“别再从这条路走”。抓包看到这个现象,你对前面讲的防环机制会有更深的理解。
4. 常见问题与故障排查实录
4.1 路由学不到:网络宣告遗漏和版本不一致
咱们先聊最常遇到的故障:配好了RIP,但show ip route rip啥也没有。这个问题我在教学生和实际项目中遇到了不下几十次,原因高度集中在两个地方。
第一个原因是network命令漏宣告了直连网段。这是新手最容易犯的错误,也是我前面反复强调的network命令语义问题。很多人的思维惯性是“我要让这些网段能被路由到”,于是只宣告了对端的网段,却忘了宣告自己接口所在的网段。但RIP的学习机制是:只有本机直连网段被network命令覆盖,这些网段才会被放进RIP更新里通告出去;同时,RIP只会在那些“被network命令覆盖的接口”上接收和处理路由更新。所以如果两个路由器之间的互联接口没有被各自的network命令覆盖,即使双方都启动了RIP,也互相学不到任何路由。排查时先执行show ip rip interface,看看哪些接口在RIP里是激活状态,一眼就能定位。
第二个原因是协议版本不匹配。如果R1用了version 2,R2忘了敲version 2,默认情况下RIPv1和v2会同时收发——但v1使用广播地址255.255.255.255,v2使用组播地址224.0.0.9,如果一个版本只接收指定版本的报文,就会忽略另一方的更新。这时show ip route rip会显示空,但在debug ip rip里能看到报错。解决思路很直接:所有路由器统一显式指定version 2。在真实项目中,我见过老设备只支持v1、新设备默认v2导致路由不通的情况,这时候要么把全网都调到v1(不推荐,除非是真老古董),要么加装协议转换手段。
4.2 路由不稳定:跳数计数和抑制计时器的“幽灵”
第二个典型的故障现象是:路由表里的RIP路由时有时无,或者过一段时间自动消失,然后又出现,像是闹鬼一样。这种问题的背后通常是两种原因。
一种是路由发生了环路,导致跳数被累加到了16。当网络中某个链路出现临时震荡时,RIP会快速传播更新消息,但如果同时存在环状拓扑,就可能出现路由信息在环路里反复传递的情况。每次传递跳数加1,直到累加到16变成不可达。这时候路由表里会出现“possibly down”状态,看起来就是路由“瞬间消失”了。解决思路需要从根源入手:检查物理链路是否稳定,确认水平分割是否在所有接口上生效,必要时调整拓扑避免环状结构。
另一种是抑制计时器引发的“隧道期”。假设一条路由从正常变为不可达,RIP会启动180秒的抑制计时器。在抑制期间,路由器即使收到来自其他邻居的替代路由,只要跳数不比原来的更优,就不会采纳。所以在拓扑发生变化后的至少3分钟里,你可能会看到路由表里的条目状态是“possibly down”,即使已经有新路径可用。这是RIP的设计特性,不是bug,但如果你在做割接验证时遇到这个现象,别慌,等计时器超时后路由自会恢复。如果等不及,可以用clear ip route *强制刷新,但注意这会带来一次全局的协议重新收敛,生产环境要谨慎操作。
4.3 路由路径不是最优:自动汇总引起的次优路径问题
还有一种让人摸不着头脑的故障:明明有更短的路径,RIP却选了一条更长的路走。这个问题的根源往往出在自动汇总和手工汇总的不当配置上。
举个例子。R3后面连着10.0.0.0/24、10.0.1.0/24和10.0.2.0/24三个网段,R2从R3学到这三条明细路由。但R2的auto-summary开着,它就会把这3条明细汇总成一条10.0.0.0/8再通告给R1。R1收到后才不管后面的明细呢,直接认为去10.0.x.x的流量都往R2方向走。如果此时R1还有一个接口连着另一个网段10.0.3.0/24,它就会想:“10.0.3.0在10.0.0.0/8里啊,按汇总路由走R2”,但实际上10.0.3.0就直连在R1上。这就造成了次优路径甚至路由黑洞。
我在做实验时就踩过这个坑,当时拓扑里有一台路由器连着两个Loopback网段,因为auto-summary开着,把非连续的网段汇总成了一个大网段,导致另外一台路由器学到的路由条目看起来“很怪”——目的地址明明应该走直连,却走了RIP。排查到最后,就是一条no auto-summary的事。
4.4 RIP故障排查万能思路:从下往上查三层
最后总结一套我自己的排查路径,你可以直接复制来用。整个过程遵循“从物理层到路由协议层”的排查逻辑:
第一步,确认接口状态。show ip interface brief,看所有涉及RIP的接口是不是up/up。接口down是万病之源,如果接口都是down的,RIP配置得再漂亮也没用。
第二步,确认直连路由。show ip route connected,看直连网段是否正常存在于路由表里。如果直连路由都不完整,RIP不可能通告出正确信息。
第三步,确认RIP进程和版本。show ip protocols,这条命令会显示出RIP的版本、network配置、邻居信息、计时器状态。我每次排查RIP必定要看这个命令,它把所有关键信息浓缩在一屏里,非常适合快速定位粗配错误。
第四步,确认路由学习和通告。show ip rip database和show ip route rip,看学到的路由是否符合预期,度量值是否正确。
第五步,看debug。打开debug ip rip,观察实际的发送和接收报文,很多抽象的问题在这一步会现出原形。看完记得undebug all。
这套排查方法不是RIP独享的,你以后学OSPF、配BGP,排查思路高度相似,只是命令细节不同——先看接口、再看直连、再看协议状态、最后抓包钻细节,一层一层剥下去,问题总能定位。
5. 实操心得与经验分享
5.1 学RIP值得关注的三个“思维转变”
配完这一整套实验之后,我特别想跟你分享三个认知上的转变,它们是我从“会敲RIP命令”到“理解动态路由协议”这一段路上最值钱的收获。
第一个转变是路由协议的“自私性”认知。RIP的每条network命令不是为了服务别人,而是为了让自己接口上的网段能被别人学到。所有的动态路由协议,本质上都是“自我宣告”加“被动听取”的组合,你宣告自己知道什么,同时从别人那里听取你不知道的。想通了这点,配置里的很多困惑就会迎刃而解。
第二个转变是“距离”的相对性。RIP把“距离”简化成了跳数,这种简化在理论上是粗糙的,但恰恰是这个粗糙让它变得容易理解和实现。当你理解了某个度量值为什么粗糙,你就能理解为什么后来的路由协议要引入开销值、链路带宽、延迟等多维参数。RIP是理解“度量值革命”的最佳起点。
第三个转变是“收敛”这件事的代价。只有跑过RIP,你才会切身感受到动态路由协议在故障时那几十秒甚至几分钟的收敛窗口。生产环境里配置动态路由,心里必须时刻装着“收敛时间”这个概念——你的网络能在多短的时间内恢复转发?这个问题决定了你在做割接、做变更时的风险预案。
5.2 给新手的配置习惯建议
最后给你几条来自实操的习惯建议,都是我用真金白银换来的教训。
第一,配置RIP前先把接口IP全部配好,检查一遍再启协议。RIP默认只宣告已经存在的直连网段,如果你先起了进程再配接口,新接口默认不会被RIP感知,容易漏宣告。虽然可以后面补network,但追加上去的过程容易出错。
第二,把no auto-summary当成默认配置写进去。生产网络里几乎所有的RIP部署都该用RIPv2并关掉自动汇总,这个习惯能帮你避开大量次优路径和路由黑洞问题。
第三,验证时多敲show命令,少凭感觉。show ip protocols和show ip rip interface是排查RIP问题时最有效率的两条命令,每改一次配置就验证一次,比一次性写完再排障高效得多。
第四,实验环境里多开debug、多抓包。Wireshark里亲眼看到RIP报文的那一刻,胜过你背十遍协议规范。模拟器就是给你折腾用的,放开手脚去抓包、去改参数、去制造故障,踩坑踩得多了,动手能力自然就上来了。
RIP确实是老协议了,但作为动态路由知识体系的基石,它的价值从未过时。希望这篇文章能帮你少走一些我走过的弯路,那这些年的折腾也算值了。
