很多人第一次在Windows上录屏时都会碰上一模一样的尴尬:忙活半天,视频倒是录下来了,点开一看画面完整,可声音要么完全没有,要么只有麦克风里的环境噪音,电脑里正在播放的音乐、游戏音效、视频原声全都不翼而飞。这个问题的根源绝大多数时候不是软件坏了,而是没搞明白Windows的声音架构——屏幕录制这件事里"音频"到底从哪来、要往哪去。我花了不少时间折腾这条链路,从系统自带的立体声混音到第三方工具的音频轨设置,踩过各种奇奇怪怪的坑,这篇就把Windows上录屏幕音频的正确姿势和排查思路完整梳理一遍。
1. 先弄清一件事:你要录的"音频"到底从哪来
录屏没声音,九成问题出在一开始就没分清"要录的是哪路声音"。很多人打开录屏软件就直接点开始录制,默认设置里音频输入设备根本不是你想象中的那个,自然录不到想要的声音。
1.1 为什么Windows自带的Xbox Game Bar录出来经常没声音
拿Windows自带的Xbox Game Bar举例,这是大家最先想到的录屏工具,快捷键Win+G呼出。它默认录的是"正在运行的游戏应用"的音频,也就是说它跟着前台应用程序走,不是跟着系统总输出走。你在桌面上打开一个浏览器播放视频、用播放器放本地电影、开腾讯会议,Game Bar经常以为"你不是在玩游戏",干脆连音频通道都不建立,或者录了半天只有麦克风声音。
更迷惑的一点是,Game Bar的录制设置里有个"录制音频"开关,很多人以为打开它就能录到系统声音,实际上它主要录的是麦克风输入和部分应用音频,并不能稳定覆盖所有系统的音频输出。我测试过几台不同配置的机器,Game Bar在不同声卡驱动下的表现差异极大,同一套设置在这台电脑能录音,换一台就彻底无声。所以如果你要做正经的屏幕录制,特别是带系统声音的那种,第一件事就是跳出"用系统自带工具"的惯性思维。
1.2 两路音频的分工:系统声音与麦克风
从音频采集的角度看,屏幕录制涉及的声音可以分成两个完全不同来源:
- 系统音频(又叫"内录"):电脑正在播放的音乐、游戏音效、视频原声、网页直播声音,这些声音最终会输出到你的扬声器或耳机,录屏软件要想办法"截获"这条链路。
- 麦克风音频(又叫"外录"):你的讲解人声、周围环境声、外接声卡接收的声音,这条链路和扬声器播放完全独立。
这两路声音在Windows里的处理逻辑和硬件通道截然不同,录屏软件要分别指定音频输入。很多录屏软件有"麦克风""系统音频""立体声混音"之类的选项,这不只是名字不同,底层走的驱动路径也完全不一样。搞懂这个区分,后面所有设置就都不迷糊了。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 立体声混音:让Windows把电脑里的声音"回放"给你录
在Windows上录制系统内部声音,最核心的概念是"立体声混音"(Stereo Mix)。这个名字在中文系统里可能显示为"立体声混音""波形输出混音"或"Stereo Mix",取决于你的声卡驱动。
2.1 立体声混音到底是个什么东西
用一个不太严谨但很好懂的生活类比:立体声混音就像在电脑里搭了一根"回音管道",任何输出到扬声器的声音信号,都会被这跟管道再送一份给录音输入。录音软件从那根管道里取数据,就能录到和你在耳机里听到一模一样的声音,包括游戏音效、音乐、系统提示音、网页视频原声。
注意一个关键词:任何输出到扬声器的声音。这意味着只要你的电脑能正常出声,立体声混音理论上能录到所有系统声音。但也因为它"抓取的是最终输出",所以声卡驱动如果做了特殊处理(比如某些音效增强、响度均衡),也会一并录进去。
2.2 启用步骤与常见"灰色不可选"的处理
打开方式很简单:
- 按 Win+R,输入 mmsys.cpl 回车,打开声音控制面板。
- 切到"录制"选项卡。
- 在空白处右键,勾选"显示禁用的设备"和"显示已断开的设备"。
- 这时一般会出现"立体声混音"(Stereo Mix),右键它,选择"启用"。
- 再右键,选择"设置为默认设备"。
但很多人的实际情况是:打开录制选项卡,里面只有麦克风,根本没有立体声混音这个选项。这种事太常见了。
注意:立体声混音不是Windows系统自带的软件功能,它依赖声卡驱动。独立声卡(比如创新的Audigy、Realtek板载声卡)大多数都有这个功能,但一是在驱动不完整时被隐藏,二是某些精简版驱动(尤其是笔记本电脑预装系统)会把它阉割掉。
如果找不到立体声混音,按下面顺序排查:
- 确认声卡驱动是完整的官方驱动,而不是Windows自动安装的基本驱动。去笔记本或主板厂商官网下对应型号的声卡驱动装上,重启再看。
- 部分"高保真音频管理器"或Realtek控制面板里有一个"录制设备隐藏"选项,放进"已禁用设备"里了,在声音控制面板勾选"显示禁用的设备"就能发现。
- 有些游戏本或外置USB声卡确实没有立体声混音,这种情况建议直接跳到下面的OBS方案,用软件层面的"桌面音频"采集替代,完全绕开驱动限制。
还有一个小坑:启用了立体声混音且设为默认设备后,如果你同时在用麦克风,语音社交软件里对方可能会听到自己的回声。这是因为立体声混音把扬声器里播放的对方声音也"混"回了录音通道。遇到这种情况,不要全局启用立体声混音,只在录屏软件里单独指定要用的音频输入,日常使用继续用麦克风作为默认设备。
2.3 什么时候必须用立体声混音,什么时候别用
需要明确的是,立体声混音虽然经典,但不是所有录屏场景的最佳解。我整理了一张表,方便你对号入座:
| 场景 | 立体声混音适用性 | 原因 |
|---|---|---|
| 录制电脑正在播放的视频/音乐 | 适用 | 能完整捕获系统输出声音,操作简单 |
| 视频会议录制 | 谨慎 | 会录到自己的回声,需配合耳机 |
| 游戏直播或游戏录制 | 一般 | 许多游戏语音软件和立体声混音冲突,回声问题严重 |
| 录屏同时要录讲解人声 | 可以但麻烦 | 需要软件支持双音频输入,否则后期要把两路声音合并 |
| 遇到DRM版权保护的视频 | 不适用 | 播放器加扰的音频在混音阶段可能是一片噪音或完全无声 |
我现在更推荐的做法是:优先使用支持"桌面音频采集"的录屏软件(比如OBS),它通过驱动或虚拟声卡从系统层面采集音频,比立体声混音更稳定、更清晰,且不会干扰日常语音通话。至于立体声混音,更适合作为检查声卡驱动是否正常的"信号灯",以及给一些老牌、只能选录制设备的小工具提供输入源。
3. 四条录制路线怎么选:从免费方案到专业工具
搞清楚音频来源原理之后,接下来就是选路线。市面上能录屏幕并采集音频的方案很多,但不是越贵越好,也不是功能越多越好。我把它们按使用成本排了个序,并结合实际体验说下选择逻辑。
3.1 路线一:OBS Studio——免费方案里的音频控制天花板
如果你要录的是游戏画面、软件操作教程、直播素材,而且对系统声音和人声同时录制有要求,OBS Studio是无脑首选。它开源免费,Windows/Linux/macOS都能用,音频采集逻辑是所有录屏工具里最透明的。
OBS里关于音频的核心配置就三处:
- 来源面板添加"音频输入采集"和"音频输出采集"(或直接使用设置里的"桌面音频"与"麦克风/辅助音频")。
- 设置-音频:把"桌面音频设备"选成你实际用来听声音的设备(扬声器/耳机),把"麦克风/辅助音频设备"选成你的麦克风。
- 这样OBS就把"系统声音"和"麦克风声音"当作两个单独的音频通道处理,互不干扰。
- 设置-输出-录音:编码器选AAC,音轨数可以选2或更多,分别对应不同的音轨。
我最推荐的做法是开两条音轨:音轨1只放系统声音,音轨2只放麦克风声音(在来源或混音器里右键音频设备,勾选对应的"音频轨道")。这样录完的视频自带双轨,后期在剪辑软件里可以单独调整音乐音量和人声音量,甚至可以把某一轨完全静音,比混成一轨再修复方便太多。
提示:OBS底部"混音器"面板可以看到实时的音量电平跳动。录制前先播放一段音乐并对着麦克风说几句话,观察两路音量是否都正常跳动。这是判断音频配置正确与否最快的方法。
关于监听,OBS默认不会把录制到的音频实时回放给你听,这是为了避免你在录制时同时听到自己和电脑声音造成啸叫。如果你确实需要监听,在混音器面板右键音频设备,选择"监听并输出"(且戴上耳机),否则不要随便开监听。
3.2 路线二:Windows自带的工具能干什么,不能干什么
不少新接触Windows的朋友想省事,盯着系统自带工具不放。我逐个测过,结论如下:
- Xbox Game Bar:能录游戏和应用,系统声音采集能力受驱动影响极大,稳定性堪忧。只适合"随手录个游戏片段"这种轻量场景。
- Windows 11 的截图工具(Win+Shift+S旁边那个)内置了屏幕录制功能,但它只录麦克风声音,不录系统声音。如果你只是想录个演示给同事看,讲话声音是主体的,可以用它。
- Clipchamp(Windows自带的视频编辑器):它本身不是录屏工具,但你可以在它里面导入录好的无声视频,再重新配音。更多人喜欢这种"先录画面、再配人声"的工作流,因为后期重录任何一段话都很方便。
一句话总结:系统自带工具更适合"录画面+后期补声音"的流程,或者临时救急。一旦涉及"我要把电脑正在播放的声音同步录进画面里",老老实实装第三方工具。
3.3 路线三:PPT自带的屏幕录制,最被低估的"轻量录课"神器
如果你录的是PPT课件、软件演示、课程讲解,而且要求不高、不想装额外软件,PowerPoint自带的"屏幕录制"功能是被严重低估的。它支持录制屏幕区域,并且在录制选项里可以勾选"音频"(这个音频指的是麦克风)。
操作流程:
- 打开PowerPoint,进到任意一张幻灯片,切换到"插入"选项卡。
- 找到"屏幕录制"按钮(老版本叫"屏幕录像")。
- 点击后底部工具栏出现控制条,勾选"音频"选项。
- 选择要录制的屏幕区域,点击录制按钮。
这个方案实际录下来,画质不错,操作简单,还自带一个小特性:录制完成后视频直接嵌入到PPT页面里,可以随时播放并重新录制。对做课件的人来说确实够用了。要注意的是它只能录麦克风,录不到系统声音,所以适合"人讲+屏幕操作"的课程场景,不适合"录一段电脑播放的视频再发出去"。
3.4 路线四:商用工具怎么选,关键看音频采集机制
市面上的商用录屏工具(Bandicam、录屏专家、Ocam、嗨格式录屏大师等)大多都支持"系统声音+麦克风"双轨录制。但它们的底层实现方式不一样,购买或下载前先问自己三个问题:
- 会不会产生水印?很多免费版强制加水印,后期要处理。
- 音频是不是可以"纯粹录系统声音,不碰麦克风"?
- 支不支持音轨分离?也就是录完是"两条音轨文件"还是"混成一个音轨"。
以我用过的Bandicam为例,它在"音频"选项卡里有一个"声音"列表,可以同时勾选"扬声器(虚拟音频通道)"和"麦克风",并且可以调整两者的音量比例。录完的视频里面音频是两轨并存的,虽然混在一个文件里,但后期软件能识别为多声道。这种设计对不想折腾OBS、又想双音轨录制的新手来说就很合适。
说到底,商用工具最大的价值不是"功能比OBS多",而是"界面更简单、参数预设更友好"。如果你愿意花十分钟跟OBS的界面混个脸熟,还是免费方案更划算。
4. 选好录制参数:音质、文件体积和后期空间怎么平衡
很多教程讲录屏只教"怎么点录制",从来不谈参数。但录制参数直接决定你录出来的视频是用来"自己看个大概"还是"能进入发布/交付"的水准。这里重点讲音频相关的几个关键参数。
4.1 采样率:44100Hz还是48000Hz
采样率是音频最基础的参数,可以理解为"每秒记录多少个声音样本点"。44100Hz是CD的标准,48000Hz是视频制作的标准。既然录的是屏幕视频,我建议统一使用48000Hz(48kHz),理由很简单:视频编辑软件的时间轴绝大多数以48kHz为工程采样率,你录的素材和工程采样率一致,后期就不会产生强制重采样带来的轻微音质损失或不同步问题。
还有一个更容易被忽略的地方:Windows系统自身的默认音频格式。右键任务栏音量图标,打开"声音设置"→"更多声音设置"→"播放"选项卡,找到你正在使用的扬声器/耳机设备,右键→"属性"→"高级",里面有一个"默认格式"下拉框。如果这里被设置成了"16位,44100Hz",那么即便录屏软件选了48kHz,实际采集到的信号源也已经被系统降级成44.1kHz了,录出来的声音肯定偏闷甚至细微变调。所以录制前先把系统默认格式和录屏软件采样率对齐。
4.2 位深、码率与文件体积
位深常见的是16bit和24bit。16bit动态范围约96dB,24bit约144dB。人耳对环境噪声的容忍范围大概是60dB,16bit已经能覆盖绝大多数录制需求。24bit的优势主要在于录制动态范围特别大的内容(比如现场演奏)、后期要做大幅度增益时不容易出现底噪放大。日常录屏选16bit完全够用。
码率决定音频细节保留程度。以常用的AAC编码为例:
| 码率 | 实际听感 | 推荐场景 |
|---|---|---|
| 128kbps | 高频稍有损失,人声可接受 | 语音备忘录、临时演示 |
| 192~256kbps | 细节较完整,大多数人的听感盲区 | 课程录制、软件演示 |
| 320kbps | 接近无损,保留音乐细节 | 游戏录制、电影片段、音乐向内容 |
文件体积方面,一条320kbps的音频轨道录制1小时大概会增加140MB左右,256kbps约115MB。如果你对文件体积敏感(比如要发微信、传网盘),用192kbps就够,听不出明显差别。
4.3 帧率与音频时基:不同步的隐患源头
视频参数里和音频同步关系最大的是帧率。Windows上录屏通常选30fps或60fps。游戏、动作画面多选60fps,操作慢的PPT教学、软件演示选30fps就够了,文件体积直接减半,后期处理压力也小。
但这里有一个隐蔽的坑:可变速帧率(VFR)与固定帧率(CFR)。部分录屏工具在CPU占用高时会自动丢弃某些帧,导致视频时间轴与音频时间轴错位,典型的症状是"前面声音对得上,越往后越偏"。OBS默认录制格式是MKV/MP4,默认就是固定帧率,一般不会有这种问题;但某些轻量录屏工具和手机录屏容易出现VFR。把录屏软件的"固定帧率"选项打开,是预防音画渐行渐远最有效的手段。
5. 典型故障排查链路:无声、爆音、音画不同步逐个击破
就算配置全对,实际操作中还是会遇到各种奇怪问题。下面按症状列几条最常见的排查链路,每一步都有明确的验证方法,照着走能节省大量时间。
5.1 症状一:录完只有画面没有声音
第一步要定位问题在"设备层"还是"软件层"。最快的办法是打开Windows自带的录音机应用(或下载个免费的小工具Audacity),先用它录一段麦克风声音,观察是否正常。
- 如果录音机也无声:说明麦克风或系统音频输入链路有问题,右键音量图标进入"声音设置"→"输入",检查默认输入设备和音量为0的情况。
- 如果录音机正常,但录屏软件没声音:问题出在软件音频源配置上,重新确认软件里"音频输入设备"选的是不是你的麦克风或立体声混音,不要默认。
还有一个高频操作失误:录之前忘了把软件里的"桌面音频"或"系统声音"开关打开。OBS桌面音频默认开启,但很多商用工具默认只开麦克风,需要手动勾选。录前花30秒在软件设置里看一眼音频设备列表,比录完再返工快得多。
5.2 症状二:声音断断续续、偶尔爆音
可能原因很多,最常见的是缓冲区太小,导致音频数据来不及处理而丢包。具体表现为声音时不时"卡一下""噼啪作响",画面却是流畅的。解决路径:
- 打开声卡驱动控制面板(Realtek高清晰音频管理器等),看看有没有"缓冲""延迟"之类的选项,适当调大。
- 在OBS里,"设置→音频→缓冲延迟"默认是1000ms,一般不用调;但如果你用的是蓝牙耳机,会出现明显延迟,建议录制系统声音时用有线耳机或直接不戴耳机(让扬声器播放),蓝牙耳机的A2DP协议在音频回传上天生就有几十到几百毫秒的延迟。
- 关闭占用大量系统资源的程序,尤其是浏览器标签页里的在线直播、网页音频。浏览器会抢占audio session,和录制软件打架时经常导致爆音。
5.3 症状三:画面不动了但声音还在走,或声音和画面越差越多
这是我遇到过最多人问的情况。先说结论:绝大多数和"可变帧率"或"播放设备与录制设备采样率不一致"有关。
举个例子:你用OBS录一个在线视频,视频源是25fps,录制设置了60fps,但播放器的视频帧节奏和系统音频时钟并不同步。电脑通过扬声器播放视频时,音频时钟来自声卡,视频时钟来自显卡/播放器,两个时钟天然有微小偏差,短时间看不出来,录到20分钟以上就会积累成明显的音画分离。
应对方案就两条:
- 录屏软件固定帧率(30fps或60fps按需选),不要让它自动匹配。
- 优先录制固定帧率的视频源。如果你要录的视频源本身是25fps,把录制帧率也设为25或50(整数倍),同步问题会大幅减少。
万一已经录出了不同步的素材,在剪辑工具里手动对齐:把音轨波形显示出来,找一处明显的冲击波形(比如拍手声、键盘敲击声),把音轨在时间轴上整体挪动直到冲击波对齐即可。剪映、Premiere Pro、Audition都能看波形对齐。
5.4 症状四:录制时耳机里听得到声音,录完却没有
这个症状最迷惑人,因为它说明扬声器通道是通的,问题必定出在采集环节。最常见的两个原因:
第一,录屏软件选择的是"立体声混音"设备,但声音控制面板里"立体声混音"被禁用或未设为默认设备,软件找不到有效输入。解决方法是回到声音控制面板,右键启用并设为默认设备,再确认软件里音频设备刷新重选。
第二,你开了"侦听此设备"功能。在声音控制面板"录制"选项卡里,右键当前麦克风→"属性"→"侦听"选项卡,如果勾选了"侦听此设备",麦克风的声音会实时从扬声器播放,你听着像"录进去了",其实只是硬件回送到耳朵里,录制软件并没有收到信号。取消勾选,再看软件电平是否跳动。
5.5 症状五:声音录制正常,但混音后噪声很大
这种一般来自麦克风增益过大。Windows的麦克风增强功能默认是关闭还好,但有些声卡驱动会默认加了20dB甚至30dB增益,再加上输入音量设置为100,录出来的底噪就非常明显。在声音控制面板里把麦克风音量调整到80左右,增强关掉,再用录屏软件里的混音器观察电平:人正常说话时,电平峰值保持在-12dB到-6dB之间比较合适,不要顶到0(会爆音)。
6. 我目前测试下来最稳的一套录制组合
前面把原理、工具、参数、排查都过了一遍,最后分享一套我个人实测下来最稳定的组合,也算是给不知道怎么下手的朋友一条捷径。
办公教学、软件演示类内容:我的首选是PowerPoint自带的屏幕录制功能,勾选"音频"对着讲就行。它录出来是MP4,画质清晰,麦克风声音直接内嵌,几乎不用设置。后期要剪的话,把文件另存出来拖进剪辑软件就行。
游戏录制、需要后期精细处理的内容:OBS Studio,双音轨,音频采样率48kHz、AAC 256kbps,系统声音走桌面音频,人声走麦克风,两条音轨分别记录。视频部分按内容性质选择1080p 60fps(动态画面)或1080p 30fps(静态操作演示),录制格式用MKV(OBS推荐,防止录制中途断电文件损坏),录完再通过OBS自带的"录制转封装"功能无损转成MP4。
需要交付给客户、追求双音轨方便对方后期调音的内容:Bandicam,在音频设置里同时勾选扬声器和麦克风,录制时保持音量电平不过载,输出用"扬声器(声音)"和"麦克风(声音)"分离模式。比OBS省心的地方是它的音轨分离做得很直观,给不太熟悉后期软件的合作方交付时不容易被问"音频轨怎么只有一条"。
有一个细节我每次录制前都会检查:把Windows系统音量、播放器音量、软件内部音量都先降到70%左右,留出至少6dB的余量。因为实际录制时往往会出现比预期更大的峰值,比如游戏里突然炸一声雷、提示音突然弹出。录到接近0dB的过载是没有办法后期修复的,但稍微压低一点音量,后期一键增强到合适范围完全可行。
另一个容易忽略的问题:如果你录制前刚插上USB耳机、USB麦克风,先对着话筒说两句话,确认Windows真的识别到了设备并且输入音量正常。USB音频设备在Windows里的时钟机制和板载声卡不同,长时间录制更容易出现微小漂移,但这里就不展开细说了,你只要记住一点:录制系统声音时,尽量用板载声卡输出,录麦克风时,尽量用同一个声卡的麦克风接口,能有效降低不同时钟设备长时间工作导致的音画不同步概率。
最后想说的是,Windows录屏声音的坑,绝大多数情况下不是谁的软件有问题,而是"音频设备选择"和"默认输入输出设置"没有搞对。想清楚你要录哪一路声音、从哪个设备进、哪个设备出,把声音控制面板里的默认设备理顺,再去看录屏软件设置,思路一下就清晰了。这篇内容基本把我这几年折腾Windows录音频的经验都倒出来了,照着一步步操作,绝大多数问题都能解决;如果还有没覆盖到的奇形怪状的现象,多半能从声音控制面板和声卡驱动设置里找到答案。
