1. 从"换了台交换机就断网"说起:为什么要吃透转发原理
做了这么多年网络运维,我见过太多类似的场景:明明只是把一台旧百兆交换机换成新的千兆交换机,结果业务系统频繁掉线;或者照着教程配完 VLAN,同一台交换机上两个端口就是不通。每次遇到这种问题,根子往往不在配置命令本身,而是对交换机最底层的转发机制理解不透。
交换机这个设备看起来"傻瓜"——插上电、连上网线就能用,但它内部干的活,远比表面复杂。它的全部核心行为,可以归结为三件事:学习 MAC 地址、查表转发、泛洪未知帧。这三件事构成了所有二层交换的基础,不管是华为、华三、思科还是锐捷,不管命令行风格怎么变,底层逻辑永远是这一套。
这篇博文我不打算给你背一遍教科书式的定义,而是想站在实际维护的角度,把交换机的转发模型、VLAN 隔离的真相、二层和三层的关系、以及那些热搜词里频繁出现的真实故障场景,一个一个拆开揉碎讲清楚。不管是刚入行的网络小白,还是被"换了交换机经常断网"这类问题折磨过的一线运维,这篇文章都值得你花十几分钟读完。你会发现,很多看似玄学的网络故障,其实都能用转发原理推导出答案。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. MAC 地址表:交换机最核心的那张"快递单"
2.1 交换机是怎么记住每台设备在哪里的
先打个比方。如果把网络里的数据帧比作快递包裹,那交换机就是一家快递中转场。中转场老板不需要知道每个包裹最终要送去哪个城市的哪条街,他只需要知道:这个包裹交给哪个出口的装卸工,能最快送到下一站。MAC 地址表,就是老板手里的那张"出口对照表"。
这张表长什么样?核心就三列:MAC 地址、端口号、VLAN ID。举个例子:
| MAC 地址 | 端口 | VLAN |
|---|---|---|
| 00:0c:29:ab:12:34 | GigabitEthernet0/0/1 | 10 |
| 00:0c:29:cd:56:78 | GigabitEthernet0/0/2 | 20 |
当一个数据帧从端口 1 进来时,交换机会做两件事:第一,把帧头里的源 MAC 地址和入端口关联起来,记录到表里——这就是"学习";第二,读取帧头里的目的 MAC 地址,去表里查找对应的出端口——这就是"查找转发"。
关键在于,这个学习过程是完全被动的。交换机不会主动扫描网络里有哪些设备,它只能从每一个经过它的帧里"偷看"源 MAC 地址,然后默默记下来。你可以通过命令行查看这张表:
code复制[Switch]display mac-address
不同厂商命令略有差异,但思路一致。华为和华三用 display mac-address,思科用 show mac address-table,锐捷用 show mac-address-table。我遇到过不少朋友,排查网络问题时脑子里根本没有"先看 MAC 表"这根弦,其实很多二层不通的问题,一查 MAC 表就能看出端倪,比如设备根本没学到对端 MAC,说明帧压根没到交换机这里。
2.2 为什么查不到目的 MAC 时必须泛洪
这是交换机工作原理里最容易让人困惑的一点:当交换机收到一个目的 MAC 地址不在表里的数据帧时,它该怎么办?
答案是泛洪——把这个帧从同一个 VLAN 内除了入端口以外的所有端口都复制发送出去。你可能会问:这不是很浪费带宽吗?为什么要这么干?
因为交换机没法确认目标设备到底挂在哪个端口下面。与其丢弃这个帧,不如广播出去赌一把。如果目标设备在线,它收到这个帧后会回复一个帧,交换机就能从回复帧里学到它的 MAC 地址,下次再转发就精准多了。
这里有个容易混淆的概念:泛洪不等于广播。广播帧(目的 MAC 全 F)是必须泛洪的,因为它的语义就是"发给所有人";但单播帧的泛洪是无奈之举,是因为表里没记录。网络里如果单播泛洪特别多,往往说明某个设备的 MAC 地址不停地在多个端口之间跳动——这就是著名的 MAC 地址漂移,最常见的原因是下联设备存在环路。
2.3 MAC 地址表会老化,别把它当静态配置
再提醒一点,MAC 地址表不是一成不变的,每条表项都有老化时间,默认通常是 300 秒。也就是说,如果某台设备 5 分钟不发送任何数据,交换机就会把它对应的 MAC 表项删掉,下次再通信时重新学习一次。
这个机制带来一个经典问题:设备明明在线,但 Ping 不通,查 MAC 表发现没有对应条目。这种情况多半是设备静默时间超过了老化时间,或者中间链路出了问题。另外,如果网络里有人手动给交换机配了静态 MAC 表项,那这种表项是不会老化的,适合用在服务器、打印机这类地址固定的设备上。不过静态表项有个坏处:如果设备换到别的端口,交换机仍然按旧表项转发,反而导致不通。所以我的建议是,除非有安全或特殊需求,否则尽量别手动配静态 MAC,让交换机自己学习就够了。
3. VLAN 隔离广播域,到底隔离了什么
3.1 广播帧是二层的"水",VLAN 是二层的"隔板"
前面说了泛洪,这里要展开另一个核心概念:VLAN。
如果整个二层网络是一个大水塘,那广播帧就是水波纹,一个设备发广播,全网都能收到。网络规模小的时候无所谓,但设备一多,广播帧每时每刻都在全网来回穿梭,消耗 CPU 和带宽,这是不可持续的。
VLAN(虚拟局域网)的诞生,本质上就是在这个水塘里加隔板。把交换机端口划分成不同的 VLAN,每个 VLAN 是一个独立的广播域。交换机收到广播帧,只会在它所属的 VLAN 内泛洪,绝对不会跨 VLAN 转发。二层交换机天生不带"跨 VLAN 转发"的能力,这是由交换机芯片的设计逻辑决定的——查 MAC 表时要匹配 VLAN ID,VLAN 对不上,直接丢弃。
3.2 同一台交换机上,VLAN 不同就是"隔了堵墙"
很多刚入门的朋友会问:同一个交换机上,端口 1 划到 VLAN 10,端口 2 划到 VLAN 20,两个端口连的电脑为什么 Ping 不通?
因为二层交换机转发数据帧时,会同时检查目的 MAC 和 VLAN。两个 VLAN 的 MAC 表项是分开维护的,VLAN 10 的表里永远不会有 VLAN 20 的设备条目,所以帧在 VLAN 10 内泛洪也到不了 VLAN 20 的端口。这就是热搜词里"二层交换机实现同一网段分割局域网原理"的实质——同一网段的设备,只要被 VLAN 隔开,二层就完全隔离,必须靠三层路由才能通信。
这里有个特别容易让新手掉坑的点:同一网段不是通信的充分条件。很多人一看到两台电脑 IP 都在 192.168.1.0/24,就觉得"同一网段肯定能通"。但在同一台二层交换机上,如果端口 VLAN 不同,这两个设备就是完全隔离的。网络通信的底层逻辑是:同网段走二层(ARP + MAC 转发),跨网段走三层(网关路由)。VLAN 把二层切断了,同网段也白搭。
3.3 Trunk 口是如何"打通"多个 VLAN 的
当多台交换机级联时,如果不同交换机上的端口需要属于同一个 VLAN,就需要用到 Trunk 口(华为称 Trunk,思科也叫 Trunk,华三类似)。
Trunk 口和 Access 口的区别,一句话就能说清:Access 口只属于一个 VLAN,发给它的数据帧不带 VLAN 标签;Trunk 口默认放行多个 VLAN,并且在帧头里打上 802.1Q 标签,标明这个帧属于哪个 VLAN。交换机收到带标签的帧后,就能准确判断它在哪个 VLAN 内转发。
实际配置时,Trunk 口最常见的坑是:两端允许通过的 VLAN 列表不一致,或者本地 VLAN(PVID)配置不同,导致帧在 Trunk 口上被错误打标或丢包。排查方法也很简单,在交换机上执行:
code复制[Switch]display port vlan
或思科的:
code复制Switch#show interfaces trunk
看看两端 Trunk 口 Allow VLAN 列表是否一致。我见过太多"交换机配置看起来一模一样但不通"的情况,最后查下来都是 Trunk 放行列表少了一个 VLAN。
4. 二层到三层的跨越:网关、VLANIF 和三层交换机
4.1 为什么二层交换机不能跨 VLAN 通信
回到本质:二层交换机处理的是数据帧,三层通信需要的是 IP 路由。跨 VLAN 通信,本质是"把帧从一个 VLAN 转发到另一个 VLAN",这要求设备必须具备路由能力——也就是查路由表、改写 MAC 地址、重新封装帧头。
普通二层交换机没有路由引擎,它的芯片只为"同 VLAN 内转发"优化,遇到跨 VLAN 的帧,只能丢弃。所以要让 VLAN 10 和 VLAN 20 互通,必须引入三层设备。
4.2 三层交换机的 VLANIF 接口,就是一个逻辑网关
三层交换机的出现,最初是为了解决"用路由器做 VLAN 间路由性能太差"的问题。它的思路很巧妙:在交换机内部虚拟出多个三层接口,每个 VLAN 对应一个,称为 VLANIF 接口。这个接口的 IP 地址,就是该 VLAN 内所有终端的网关地址。
设备要跨 VLAN 通信时,流程是这样的:
- 发送方发现目的 IP 不在自己网段,把帧发给网关(VLANIF 接口的 MAC 地址)。
- 三层交换机收到帧,剥离二层帧头,查看 IP 头,路由表告诉它这个目的网段对应哪个 VLANIF 接口。
- 交换机把帧重新封装,目的 MAC 换成接收方主机的 MAC,源 MAC 换成目标 VLANIF 的 MAC,从对应端口发出去。
整个过程对终端是透明的,终端只觉得自己在"通过网关访问别的地方",根本不知道这个网关其实是交换机内部的一个逻辑接口。
华为和华三的配置逻辑一致,在 VLANIF 下配 IP 地址:
code复制[Switch]interface Vlanif 10
[Switch-Vlanif10]ip address 192.168.10.1 255.255.255.0
很多朋友混淆的"华为三层交换机"配置,其实就是这些 VLANIF 路由接口的组合应用。三层交换机和路由器最大的区别在于:路由器每个物理接口通常是一个三层接口,而三层交换机可以把任意 VLAN 映射到一个虚拟三层接口,端口密度和转发性能远高于同档位路由器。
4.3 二层交换机和三层交换机怎么选
这是个老生常谈但永远有人问的问题。我的建议很简单:
- 所有终端都在一个网段,只做接入,选二层交换机就够了。
- 需要划 VLAN、做部门隔离、还要跨 VLAN 互访,直接上三层交换机。
- 出口路由、NAT、防火墙策略这些活,交给路由器或防火墙设备,不要指望交换机包办一切。
顺带一提,很多人买三层交换机当二层用,这没问题,但别浪费了它的路由能力;反过来,别指望二层交换机通过软件方式模拟 VLAN 间路由,性能会非常感人。
5. 从热搜词看高频实战场景:SSH、堆叠、POE、ARP 防护
热搜词的价值在于,它直接暴露了真实运维中最常被搜索、最容易出问题的点。这一节我挑几个典型场景,把背后的原理和配置思路串起来。
5.1 交换机的管理通道:SSH 配置的正确姿势
华为交换机默认只开 Telnet,但 Telnet 明文传输密码,在内部网络里还能忍,一旦出了公司网络或者跨公网管理,必须换成 SSH。配置 SSH 的基本逻辑是:
- 生成 RSA 密钥对。
- 开启 SSH 服务。
- 配置 VTY 用户界面,允许 SSH 登录。
- 配置本地用户和认证方式。
华为交换机上典型配置:
code复制[Switch]rsa local-key-pair create
[Switch]ssh user admin authentication-type password
[Switch]ssh user admin service-type stelnet
[Switch]user-interface vty 0 4
[Switch-ui-vty0-4]authentication-mode aaa
[Switch-ui-vty0-4]protocol inbound ssh
[Switch]aaa
[Switch-aaa]local-user admin password cipher 123456
[Switch-aaa]local-user admin privilege level 3
[Switch-aaa]local-user admin service-type ssh
注意几个细节:第一,VTY 下的 protocol inbound ssh 会把 Telnet 也禁掉,如果你想保留 Telnet 应急,需要用 protocol inbound all 或者单独配 SSH 端口;第二,默认情况下华为交换机 SSH 版本是 V1,建议在高版本设备上开启 V2,安全性好很多;第三,SSH 密钥生成后建议备份,否则设备重启后密钥变化会导致客户端报警。
5.2 堆叠:多台交换机伪装成一台的魔法
热搜词里"华为交换机堆叠"和"华三交换机堆叠"出现频率极高,说明这套方案在企业里已经非常普遍。堆叠(iStack / IRF)的原理,本质上就是把多台物理交换机通过专用堆叠口高速互联,然后把它们当成一台逻辑交换机来管理和转发。控制平面统一,转发平面并行,对外只暴露一个管理 IP,这和我们前面讲的"一台交换机维护一张 MAC 表"的关系是:堆叠系统内部会同步 MAC 表项,保证任何一台成员交换机都能正确转发。
堆叠的好处显而易见:管理简单、冗余可靠、带宽叠加。但风险也大——配置错了,可能导致整个堆叠分裂,网络直接瘫痪,所以日常维护中我特别强调:改堆叠配置前,先保存当前配置,再检查堆叠口的连线是否牢靠。堆叠分裂后两台交换机都以为自己是主设备,会同时抢占管理 IP,全网瘫痪,这是经典的生产事故场景。
5.3 POE 交换机和摄像头:功率预算永远是第一位的
海康摄像头配 POE 交换机,是安防项目里最常见的组合。POE 交换机能通过网线给摄像头供电,省掉电源适配器。但这里有个核心概念,很多人忽略了:POE 供电有预算限制。
POE 交换机每个端口的供电能力有上限(通常 15.4W 或 30W),整机也有最大输出功率(比如 120W 或 250W)。一台 8 口 POE 交换机,接了 8 个功耗 20W 的摄像头,显然会超预算。超了会怎样?交换机会按端口优先级断电,或者部分端口无法供电,摄像头起不来。
所以选型时,一定要先算总功率:
code复制单台摄像头最大功耗 × 摄像头数量 + 余量(建议 20%)≤ POE 交换机整机 POE 预算
另外,POE 协商失败的现场也很多,比如网线质量差、长度超过 100 米,导致供电不稳定。这时要检查交换机的 POE 状态:
code复制[Switch]display poe-power
看看每个端口的供电功率和状态。顺便提醒一句:POE 交换机上那些不用的端口,最好也做下 VLAN 隔离或直接 shutdown,防止摄像头 VLAN 里的广播帧影响办公网络。
5.4 ARP 防护:华三交换机的实际应用
另一类热搜是"华三 S5110 开启 ARP 防护"。ARP 攻击通常是局域网内某台主机伪造网关的 MAC 地址,向全网发送虚假 ARP 回复,把其他终端的流量骗到自己这里,形成中间人攻击。防御思路是让交换机信任正确的网关 MAC,并丢弃其他来源的 ARP 报文。
华三交换机上常用的是 ARP 入侵检测和 IP-MAC 绑定:
code复制[H3C]arp detection enable
[H3C-GigabitEthernet1/0/1]arp detection trust
配置后,交换机只在 Trust 端口上接收 ARP 报文,其他端口的 ARP 报文会被检查,来源不匹配的直接丢弃。真要说透,这其实是从转发原理延伸出来的"安全变体"——交换机的转发模型里有一个"ARP 表"(IP 到 MAC 的映射),攻击者是在污染这张表,ARP 防护是在保护这张表不被非法修改。
6. 真实故障复盘:一次"换交换机后频繁断网"的完整排查链路
6.1 故障现象和初步判断
前方提到"换了交换机经常断网"这个热搜,正好对应我去年处理过的一个真实 case,拿来当复盘素材再合适不过。
那是一个有 40 多台电脑的小型办公网络,原来用一台旧的 24 口百兆交换机,后来因为网速瓶颈,换了一台新的 24 口千兆交换机。换完后,问题立刻出现:大概每过十几分钟,就有几台电脑同时断网,过一两分钟又自动恢复。断网期间,Ping 网关丢包率接近 100%,但交换机本身管理地址可以 Ping 通。
初步判断指向二层转发异常。我先查了 MAC 地址表:
code复制[Switch]display mac-address
结果发现有个 MAC 地址在多个端口之间反复跳动,尤其是两个下联的接入交换机端口之间。MAC 地址漂移,九成九是环路。
6.2 定位根因:环路为什么会导致断网时断时续
环路的问题用我们前面讲的泛洪机制来解释就非常清晰。当交换机之间存在物理环路时,广播帧会在环路上无限循环,形成广播风暴。每一帧都会让交换机不断学习、泛洪、再学习,MAC 地址表被彻底搅乱,正常单播帧的转发路径也完全错乱。这时候网络时通时断,表现就是"一会儿断网一会儿恢复"。
我再查了交换机 CPU 利用率:
code复制[Switch]display cpu-usage
结果 CPU 飙到 80% 以上。这说明二层的广播帧已经多到把转发芯片拖垮了。
6.3 找到环路点并解除
通过逐端口排查,发现在两台接入交换机之间,除了正常的级联线之外,还多了一根网线——新交换机换上来时,机房整理网线的人把一条备用线也插上了。两根线一接,物理环路形成。
把多余那根线拔掉后,MAC 地址表不再漂移,CPU 利用率回落到 5% 以下,网络彻底恢复稳定。
6.4 避免复发的两条长效手段
这个 case 暴露了另一个问题:整个网络没有启用 STP(生成树协议),所以环路一旦形成,没有任何机制自动阻断。
两条长效手段,我给所有维护网络的朋友都建议加上:
第一,在交换机上启用 STP/RSTP。
code复制[Switch]stp enable
[Switch]stp mode rstp
启用后,即使有人不小心插了多余网线,STP 会自动阻塞冗余链路,防止广播风暴形成。
第二,规范线缆管理。机房里的网线两端都做好标签,不用的端口做 disable 处理:
code复制[Switch]interface GigabitEthernet0/0/5
[Switch-GigabitEthernet0/0/5]shutdown
别小看这一步,网络故障里至少有三成,最后查下来都是物理链路管理混乱造成的。
6.5 从这次故障提炼出的排查顺序
结合这次经历,我把二层网络"频繁断网"类的排查顺序整理成一套可复用的顺序,供参考:
- 先看链路状态和端口收发光功率,排除物理层问题。
- 查 MAC 地址表,有没有漂移或异常学习。
- 查交换机 CPU 利用率,有没有被广播帧打满。
- 确认 STP 是否启用,检查阻塞端口状态。
- 最后才去看配置变更、IP 冲突这类上层问题。
按这个顺序走,绝大多数"换交换机后断网"的问题都能在十分钟内定位。
7. 关于端口速率协商:为什么明明千兆口,跑起来只有 10 兆
热搜词里还有一个高频痛点:"交换机网速只有 10 兆",以及"25GE 口强制千兆全双工命令"。这两个问题表面上是速率协商,背后还是二层转发芯片的电气特性问题。
交换机端口和终端网卡之间会自动协商速率,协商机制是双方发送特定的脉冲信号,互相告知自己支持的最高速率、双工模式。如果协商失败,端口会以最低的 10M 半双工模式工作,网速自然惨不忍睹。
常见的导致协商失败的原因:
- 网线质量差,或者超过有效距离(超过 100 米,信号衰减严重)。
- 网线内部的线对不匹配,特别是用了四芯线(百兆)冒充八芯线,千兆协商必挂。
- 一端手动强制了速率,另一端是自动协商,可能导致双方协商异常。
排查方法是看端口状态:
code复制[Switch]display interface GigabitEthernet0/0/1
重点看 Speed、Duplex 两行。如果显示 Speed: 10M, Duplex: Half,基本就是协商失败。
解决办法:检查并更换网线,或者在生产允许的条件下,手动把端口强制成预期速率。华为交换机上强制端口速率和双工的常见命令:
code复制[Switch]interface 25GE0/0/1
[Switch-25GE0/0/1]speed 1000
[Switch-25GE0/0/1]duplex full
不过这里必须提醒一句:强制速率只应在两端设备能力一致的情况下使用,而且尽量不要一端手动一端自动,这是最经典的速率协商失败组合。我见过的做法是:如果线路短且线缆质量好,直接两端都强制千兆全双工;否则乖乖用自动协商,别偷懒。
8. 回顾与收尾:原理通了,命令只是细节
写到这里,你会发现所有交换机的操作——无论是 SSH 配置、VLAN 划分、堆叠管理,还是 ARP 防护、速率调整——本质上都围绕着同一个核心展开:交换机是一台基于 MAC 地址表做精确转发的设备,VLAN 决定了它的转发边界,广播帧是它最原始的传播方式,而环路则是最容易让它崩溃的敌人。
命令行也好、网页界面也罢,都只是在调用这个底层模型的能力。所以我在带新人的时候,从来不让他们先背命令,而是先画图、先解释转发流程。命令忘了可以查手册,原理不通才是真要命。
最后分享一个我自己的习惯:每次给交换机做完配置,我都会先用 display current-configuration 看一眼结果,再用 display mac-address 和 display interface 做校验。配置完不等于配置对,设备实际怎么跑,只有看这些底层状态表才知道。这也是我最想让你带走的一句话——理解转发原理,不是为了考试,是为了你在排障时,能用逻辑推演代替瞎猜。
