1. 为什么学C语言编程,排序算法是绕不开的第一关
C语言、算法、排序,这三个词凑在一起,基本就是初学者接触编程之后遇到的第一个“劝退组合”。我当年在大一学C语言的时候,前面几周还能跟着抄抄代码,一讲到排序算法,班里瞬间分成了两拨人:一拨是上课听懂了但一下课就忘的,另一拨是上课就没听懂、课后彻底放弃的。说句实话,C语言语法本身不难,难就难在用它去实现算法的时候,你得同时处理指针、数组边界、循环条件、函数返回值这些细节,任何一个地方不注意,排序结果就是错的。
这篇内容算是我自己学习C语言排序算法的一份完整复盘,从最基础的冒泡、选择、插入,到进阶的快排、归并、堆排,再到实际开发里更常用的qsort库函数和结构体排序,每一步我都会讲清楚“它是怎么想的”“代码怎么写”“踩过哪些坑”。适合正在学C语言基础、准备参加考试或者刷题(比如PAT乙级、蓝桥杯)的朋友参考。不管你是刚学完指针还是已经进入数据结构阶段,这篇文章都会对你有帮助。
很多人问过我一个问题:排序算法学了到底有什么用?是不是就是考试会考?我的理解是,排序是你锻炼“用程序解决问题”能力的第一课。它足够简单,规则谁都懂——把一堆数从小到大排好——但实现起来又足够复杂,涉及比较、交换、循环嵌套、时间复杂度分析。你学会了排序,就相当于学会了用计算机的思维去处理一个问题:把一个直观的想法翻译成机器能执行的步骤,再逐步优化它。
这篇文章我不想写成教科书式的原理堆砌,而是按照我自己当初的学习路径来写。当时没人告诉我哪些地方要重点理解,哪些坑可以不踩,所以这一路绕了不少弯路。现在把这些经验整理出来,希望能让你少走点弯路。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 学习排序算法前,先想清楚这3件事
2.1 排序算法的本质是“比较”和“移动”
要理解排序,先要回到最朴素的场景。给你一摞扑克牌,让你从小到大排列,你会怎么做?大多数人会先扫一遍找出最小的放最前面,然后继续找第二小的……这就是选择排序的原始模型。还有人会把牌一张张抽出来,插到前面已经排好序的牌堆里,这就是插入排序的思路。如果你比较懒,每次只把相邻的两张牌比较一下、顺序不对就交换,一遍一遍重复直到全部有序,那就是冒泡排序。
你可以发现,所有排序算法的核心动作只有两个:比较(决定两个元素的相对顺序)和移动/交换(改变元素的位置)。我们分析一个排序算法的好坏,本质上就是在分析这两个动作各做了多少次,以及它们如何随着数据规模n增长而变化。
这里要强调一个初学者最容易忽略的点:排序算法虽然叫“算法”,但它和你写的C语言的循环、数组、指针紧密相关。你写的每一次比较、每一次交换,最后都要落实到具体的代码语句上。理解了“比较和移动”这个抽象层面的东西,再去看具体代码会通透很多。
2.2 先掌握时间复杂度这个概念
学习排序算法,绕不开时间复杂度。我第一次看“O(n²)”和“O(n log n)”这种记号的时候,完全懵了,不知道是什么意思。后来我用一个生活化的类比才理解:假设你整理100张卡片花了1分钟,如果算法是O(n²)的,那么整理200张卡片大约要花4分钟(因为200是100的2倍,平方之后就是4倍的时间),整理1000张卡片就要花100分钟。如果是O(n log n)的算法,200张大约只要2.2分钟,1000张大约只要3分钟。
所以,为什么快速排序、归并排序被认为是“好算法”,而冒泡排序在大数据量下“不堪一击”?就是因为它们的增长速度差了整整一个数量级。这个理解要刻在脑子里,后续学习任何算法,时间复杂度的分析都是第一个要问的问题:这个算法的耗时随数据量增大是怎么增长的?
2.3 建议按“先理解思想,再写代码,最后优化”的顺序学
我见过很多同学,一上来就背代码,背到后面几周就混成一团,问他冒泡和插入有什么区别,说不出来。正确的打开方式应该是:先不看代码,用纸和笔手动模拟一遍排序过程。比如给5个数字,自己按照冒泡排序的规则,手动把每趟的结果写下来。手写几遍之后,你会发现这个算法的每一步都非常清晰,然后回到代码里,每一行代码对应你的哪一步操作,自然就理解了。
所以下面每讲一个算法,我都会先描述它的“思路模型”,再给代码,最后补充优化和避坑。这个顺序也是我推荐给你的学习顺序。
3. 基础排序三兄弟:冒泡、选择、插入
3.1 冒泡排序:最直观但效率垫底
冒泡排序的思路是:从第一个元素开始,依次比较相邻的两个元素,如果顺序不对就交换。这样每一趟下来,最大的元素就像气泡一样“浮”到最后面。下一趟继续从头开始,但已经排好的最后一个元素就不需要再参与比较了。
c复制void bubble_sort(int arr[], int n) {
for (int i = 0; i < n - 1; i++) {
// 每趟比较的范围逐渐缩小
for (int j = 0; j < n - 1 - i; j++) {
if (arr[j] > arr[j + 1]) {
int temp = arr[j];
arr[j] = arr[j + 1];
arr[j + 1] = temp;
}
}
}
}
这段代码我相信绝大多数人都写过。它的时间复杂度是O(n²),因为外层循环n-1趟,内层循环平均n/2次比较,乘积就是O(n²)。
这里有一个非常经典的优化点。如果某一趟从头到尾一次交换都没发生,说明数组已经全部有序了,后面的所有趟数都是白跑的。我们可以用一个标记变量记录这一趟是否有交换:
c复制void bubble_sort_optimized(int arr[], int n) {
for (int i = 0; i < n - 1; i++) {
int swapped = 0;
for (int j = 0; j < n - 1 - i; j++) {
if (arr[j] > arr[j + 1]) {
int temp = arr[j];
arr[j] = arr[j + 1];
arr[j + 1] = temp;
swapped = 1;
}
}
if (swapped == 0) break; // 没有交换,已经有序
}
}
这个优化在数据基本有序的情况下效果极其明显。比如数组是{1, 2, 3, 4, 5},第一趟扫描一次交换都没有,直接退出,时间复杂度降到O(n)。我当时测试的时候,用一个接近有序的大数组去对比优化前和优化后的版本,耗时差距是十几倍。
注意:冒泡排序是稳定排序。因为只有在arr[j] > arr[j+1]时才交换,相等的元素永远不会交换位置,所以原本相同元素的相对顺序会被保留。这一点在后面的结构体排序里很重要,先在这里记住“稳定”这个概念。
3.2 选择排序:最简单的“找最小”
选择排序的思路更符合人的直觉:第一趟在全部元素中找到最小的,和第1个位置交换;第二趟在剩下的元素中找到最小的,和第2个位置交换;以此类推。每趟只需要一次交换,比较的次数仍然很多。
c复制void selection_sort(int arr[], int n) {
for (int i = 0; i < n - 1; i++) {
int min_index = i; // 记录最小元素的下标
for (int j = i + 1; j < n; j++) {
if (arr[j] < arr[min_index]) {
min_index = j;
}
}
if (min_index != i) {
int temp = arr[i];
arr[i] = arr[min_index];
arr[min_index] = temp;
}
}
}
这个算法的关键点是:内层循环只是“找最小值的下标”,找到之后才交换。很多人写选择排序的时候,边找边交换,这样就退化成了一种奇怪的冒泡,效率反而更差。
选择排序的优点是交换次数少,每一趟最多一次交换,总共最多n-1次。缺点是无论如何都要比较完全部元素,就算数组已经有序,也仍然要比较n(n-1)/2次,所以它的时间复杂度稳定在O(n²),没有最好情况。
这里要特别提醒一个刚从冒泡转过来的人容易犯的错误:找最小值的时候,一定要保存下标,而不是保存值。因为交换的时候你需要知道位置。只保存值的话,交换的时候就不知道和哪个位置换了。
我当年就写过这样的代码:min变量保存了最小值,交换的时候才发现不知道把它换到哪去,最后又回头去遍历数组找这个值的下标,白浪费了一趟循环。
3.3 插入排序:扑克牌里的智慧
插入排序的思路是:把数组分为两部分,前面是已经排好序的,后面是未排序的。每次从未排序部分取出第一个元素,插入到前面有序部分的合适位置。这就是大多数人打扑克牌时整理手牌的方法。
c复制void insertion_sort(int arr[], int n) {
for (int i = 1; i < n; i++) {
int key = arr[i]; // 当前要插入的元素
int j = i - 1;
// 往前找位置,同时把比key大的元素往后移
while (j >= 0 && arr[j] > key) {
arr[j + 1] = arr[j];
j--;
}
arr[j + 1] = key; // 插入到正确位置
}
}
插入排序在数据基本有序的时候效率特别高,因为内层循环几乎不用移动元素。在数据量小(比如n < 50)的时候,插入排序甚至可以打败快速排序,这个结论在算法竞赛中经常用到。
这里有个很实用的技巧:在插入排序的基础上加“哨兵”。哨兵的思想是在数组开头留一个空位,用来存放key值,这样可以省略判断j >= 0,让循环少一次判断。C语言里可以直接用普通写法,但理解了哨兵思想有助于后续学习更高级的算法。
初学者写插入排序最容易出的bug是:把arr[j] > key写成arr[j] >= key。这样会导致相等元素的相对顺序被破坏,排序不再稳定。同时,>=的写法在某些极端情况下还会使循环多跑很多次,性能下降。尽量写成>,保持稳定性。
3.4 三个基础算法的对比
| 算法 | 最好时间复杂度 | 最坏时间复杂度 | 空间复杂度 | 稳定性 |
|---|---|---|---|---|
| 冒泡排序(含优化) | O(n)(已有序) | O(n²) | O(1) | 稳定 |
| 选择排序 | O(n²) | O(n²) | O(1) | 不稳定 |
| 插入排序 | O(n)(已有序) | O(n²) | O(1) | 稳定 |
选择排序为什么不稳定?举个例子:数组{5, 5, 3},第一趟找到最小的3下标为2,和下标0的5交换,两个5的相对顺序就变了。这在只需要给数字排序时没什么影响,但在按成绩排序、成绩相同再按学号排的时候,稳定性就是一个重要指标。
学完这三个基础排序之后,你应该对“算法复杂度”和“稳定性”这两个概念有了直观感受。接下来我们进入更重要的进阶部分。
4. 进阶排序:快排、归并、堆排
4.1 快速排序:分而治之的典范
快速排序是所有排序算法里实际应用最广泛的思路,C标准库的qsort底层在大多数情况下就是快速排序的变体。它的核心思路是分治:从数组中选一个基准值(pivot),把小于基准值的放到左边,大于基准值的放到右边,然后递归地对左右两部分继续进行同样的操作,直到区间只剩一个元素。
初学快排时最常犯的错误是试图用额外的数组来暂时存放左右两边的元素。这样做逻辑上没问题,但空间复杂度变成O(n),就失去快排“原地排序”的意义了。正确的做法是使用双指针交换法:
c复制void quick_sort(int arr[], int left, int right) {
if (left >= right) return;
// 以最左边的元素为基准值
int pivot = arr[left];
int i = left;
int j = right;
while (i < j) {
// 从右往左找第一个小于pivot的元素
while (i < j && arr[j] >= pivot) j--;
// 从左往右找第一个大于pivot的元素
while (i < j && arr[i] <= pivot) i++;
if (i < j) {
// 交换两个找到的元素
int temp = arr[i];
arr[i] = arr[j];
arr[j] = temp;
}
}
// 基准值归位
arr[left] = arr[i];
arr[i] = pivot;
quick_sort(arr, left, i - 1);
quick_sort(arr, i + 1, right);
}
这个版本是初学者比较容易掌握的写法。这里有两个细节值得强调:
第一个细节是查找顺序。上面的代码是先从右往左找,再从左往右找。如果反过来,先从左往右找,再右往左找,最后基准值归位就会出bug。这是因为基准值取的是最左边的元素,最后要把基准值和某个元素交换,这个元素必须是一个小于等于基准值的数,才能保证交换后基准值左边都小、右边都大。从左往右找的是大于基准值的数,如果先完成左指针的移动,最后i可能停在一个大于基准值的元素上,交换后基准值右边就会混入小于它的元素。
第二个细节是边界条件的判断。内层两个while都必须加上i < j条件,不然指针可能越界。我在调试快排时遇到过无数次数组越界、栈溢出、死循环的问题,排查下来基本都是这两个地方出了问题。如果你实在调不出来,最有效的方法是在每一趟排序前后打印整个数组,肉眼观察基准值的位置对不对。
快速排序的时间复杂度,平均是O(n log n),最坏是O(n²)。最坏情况发生在每次选基准值时都选到最大或最小值,导致左右两边极度不平衡。比如一个已经有序的数组,如果每次都取第一个元素作为基准值,就会退化成O(n²)。解决办法是“三数取中”:取数组第一个、中间、最后一个元素的中位数作为基准值,能显著降低最坏情况出现的概率。
注意:快排是不稳定排序。因为基准值会跨越很长距离交换,相同元素的相对顺序在交换过程中很容易被破坏。
4.2 归并排序:稳定排序的王者
归并排序的思路是:把数组从中间分成两半,对两半分别排序,然后把两个有序的数组合并成一个有序的数组。这同样是一个分治策略,但和快排不同的是,归并排序的时间复杂度在任何情况下都是O(n log n),非常稳定。
归并排序的经典写法需要用到临时数组。合并时,两个有序子数组分别用下标控制,谁小就先把谁放进临时数组。一个比较难处理的点是:一个子数组已经放完,另一个还剩一堆,需要把剩下的全部拷过去。
c复制void merge(int arr[], int temp[], int left, int mid, int right) {
int i = left; // 左半部分起始
int j = mid + 1; // 右半部分起始
int k = left; // 临时数组的写入位置
while (i <= mid && j <= right) {
// 注意这里是 <=,保证稳定性
if (arr[i] <= arr[j]) {
temp[k++] = arr[i++];
} else {
temp[k++] = arr[j++];
}
}
while (i <= mid) temp[k++] = arr[i++];
while (j <= right) temp[k++] = arr[j++];
// 把临时数组复制回原数组
for (int t = left; t <= right; t++) {
arr[t] = temp[t];
}
}
void merge_sort(int arr[], int temp[], int left, int right) {
if (left >= right) return;
int mid = left + (right - left) / 2;
merge_sort(arr, temp, left, mid);
merge_sort(arr, temp, mid + 1, right);
merge(arr, temp, left, mid, right);
}
这里有一个非常重要的细节:合并的时候,当左半部分元素等于右半部分元素时,必须先取左半部分的元素(即arr[i] <= arr[j]才把左边放入临时数组)。这样才能保证相同元素的相对顺序不被改变,归并排序因此是稳定排序。如果写成arr[i] < arr[j],稳定性就丢失了。
归并排序的空间复杂度是O(n),因为它需要一个和原数组等长的临时数组。这也是它在内存预算紧张时不如快排受欢迎的原因。但在外部排序(比如对文件中的数据排序,数据量大到无法全部读入内存)的场景下,归并排序分而治之、逐块合并的策略是无可替代的。
我实际测试过,归并排序对各类数据(有序、逆序、随机、大量重复)的耗时非常均匀,而快速排序在特定数据下会大幅波动。在需要性能稳定可控的场景,归并排序更省心。
4.3 堆排序:利用完全二叉树结构
堆排序用到的数据结构是“堆”,它是一棵完全二叉树,并且满足堆性质。大顶堆的每个节点都大于等于它的左右孩子。堆排序的步骤是:先把数组原地调整成一个大顶堆,然后反复把堆顶(最大值)和当前堆的末尾元素交换,把最大值固定到最终位置,再将剩余元素重新调整成堆。
c复制void heapify(int arr[], int n, int i) {
int largest = i;
int left = 2 * i + 1;
int right = 2 * i + 2;
if (left < n && arr[left] > arr[largest]) largest = left;
if (right < n && arr[right] > arr[largest]) largest = right;
if (largest != i) {
int temp = arr[i];
arr[i] = arr[largest];
arr[largest] = temp;
heapify(arr, n, largest); // 递归调整受影响的子树
}
}
void heap_sort(int arr[], int n) {
// 从最后一个非叶节点开始,自底向上构建大顶堆
for (int i = n / 2 - 1; i >= 0; i--) {
heapify(arr, n, i);
}
// 逐个把最大值放到末尾
for (int i = n - 1; i > 0; i--) {
int temp = arr[0];
arr[0] = arr[i];
arr[i] = temp;
heapify(arr, i, 0);
}
}
堆排序最让人头疼的地方是下标计算。数组元素下标从0开始时,左孩子是2i+1,右孩子是2i+2。很多教材为了方便介绍,下标从1开始,左孩子是2i,右孩子是2i+1。在C语言里如果照搬教材代码,很容易出现下标越界。我建议始终记住“C语言数组下标从0开始”这条铁律,遇到堆排序就统一用2*i+1这套公式。
另一个容易困惑的点是构建大顶堆的起始位置:n/2-1。这个位置是最后一个非叶子节点。为什么?因为最后一个叶子节点的下标是n-1,它的父节点是(n-1-1)/2 = n/2-1。从最后一个非叶子节点开始往前逐个做heapify,就能保证整个数组满足堆性质。
堆排序的时间复杂度是O(n log n),并且是就地排序(空间复杂度O(1)),这三兄弟里只有它同时做到这两点。但它有一个特点:堆排序是不稳定排序,而且在实际测试中,它的常数通常比快速排序大,所以大多数通用排序场景优先选快排,堆排序常用于需要O(1)额外空间的场景。
4.4 四种进阶排序的取舍
| 算法 | 平均时间 | 最坏时间 | 额外空间 | 稳定性 | 核心优势 |
|---|---|---|---|---|---|
| 快速排序 | O(n log n) | O(n²) | O(log n) | 不稳定 | 综合速度最快 |
| 归并排序 | O(n log n) | O(n log n) | O(n) | 稳定 | 性能稳定 |
| 堆排序 | O(n log n) | O(n log n) | O(1) | 不稳定 | 空间占用极小 |
实际选择时我的建议是:数据量不大(几千个以内)就用插入排序或直接调用库函数;数据量较大、没有稳定性要求,用快速排序;有稳定性要求,用归并排序;内存极紧张、不允许额外数组,用堆排序。
5. C语言里的工程实践:qsort、结构体、字符串、文件排序
5.1 qsort库函数:考试和工作中都该用的工具
学完手写排序算法之后,你可能会有一个疑问:既然算法这么复杂,我写程序时难道每次都要自己手写一遍吗?当然不用。C标准库已经提供了一个通用的排序函数qsort,对任意类型的数据都能排序,前提是你提供一个比较函数。
c复制#include <stdlib.h>
// 比较函数:升序排列
int compare(const void *a, const void *b) {
int ia = *(const int *)a;
int ib = *(const int *)b;
if (ia < ib) return -1;
if (ia > ib) return 1;
return 0;
}
int main() {
int arr[] = {5, 2, 8, 1, 9};
int n = sizeof(arr) / sizeof(arr[0]);
qsort(arr, n, sizeof(int), compare);
return 0;
}
qsort接受四个参数:数组首地址、元素个数、每个元素的大小、比较函数的指针。这里的比较函数返回值表示a和b的大小关系:负数表示a排在b前面,正数表示b排在a前面,0表示相等。
初学者最容易在这里犯的错误是:比较函数直接写成return *(int*)a - *(int*)b;。对于整数来说,大多数情况下确实能正确工作,但如果两个数的差值超过了int的表示范围,就会发生整型溢出,导致错误结果。我在做算法题的时候遇到过好多次这种隐蔽的bug。规范写法是分别判断大于、小于、等于三种情况,算出确定的-1、0、1。
5.2 结构体排序:多关键字排序怎么做
在真实项目中,排序的对象很少只是一个整数数组,更多是对结构体按照某个字段排序。比如按照学生的成绩排序,成绩相同再按照学号排序。这种需求很适合用qsort处理。
看一个例子。定义学生结构体,包含姓名、成绩、学号三个字段:
c复制typedef struct {
char name[50];
int score;
int id;
} Student;
int compare_by_score_then_id(const void *a, const void *b) {
const Student *sa = (const Student *)a;
const Student *sb = (const Student *)b;
// 第一关键字:成绩降序
if (sa->score != sb->score) {
return sb->score - sa->score; // 注意这里是降序
}
// 第二关键字:学号升序
if (sa->id != sb->id) {
return sa->id - sb->id;
}
return 0;
}
多关键字排序就是指“如果第一关键字相同,再比较第二关键字”。上面的比较函数严格来说也隐含了一点稳定性问题,但因为学号可以唯一区分每个学生,所以这里不会出现“稳定排序”的需求。
真正需要在结构体排序中关注稳定性的场景是:你只有单关键字,比如只按成绩排序,但成绩相同的学生希望保持原本在数组中的先后顺序。这时如果手写排序,就必须选择稳定排序算法;如果用qsort,标准库实现通常是不稳定的,不能依赖它来保持原顺序。所以如果你对稳定性有明确要求,手写归并排序是更可靠的方案。
还有一个在C语言里非常容易踩的坑:结构体里的name字段比较不能直接用>、<。字符串比较必须用strcmp函数,返回值为负、零、正分别表示小于、等于、大于。很多人第一次写结构体排序时尝试,就会报错。
5.3 字符串排序:不是“比较字符串”那么简单
字符串排序在竞赛和作业里频繁出现。比如PAT乙级的题目,经常要按字典序输出多个字符串。C语言里“字符串”实际上是以'\0'结尾的字符数组,不能直接用>比较。排序的核心是借助strcmp。
手写字符串排序时,有一个非常经典的坑:字符数组之间不能直接赋值。你写temp = arr[i],编译器会报错,因为数组名不是可赋值的左值。正确的做法是使用strcpy函数进行字符串内容的复制,或者干脆用“指针数组”,让每个指针指向一个字符串常量,然后交换指针,这样效率更高、代码也更简洁。
c复制const char *words[] = {"banana", "apple", "cherry", "date"};
int n = 4;
qsort(words, n, sizeof(const char *), compare_strings);
int compare_strings(const void *a, const void *b) {
const char **sa = (const char **)a;
const char **sb = (const char **)b;
return strcmp(*sa, *sb);
}
第一次看到const char **sa = (const char **)a;这个双重指针转换可能会懵,它的意思是:a指向数组里的一个元素,而这个元素本身是一个const char *指针。所以先把a转成“指向字符指针的指针”,再解引用得到那个字符指针,最后strcmp。绕着弯的地方就在于“字符串本身就是一个指针”,而qsort要求传地址,所以地址的地址就是双重指针。
5.4 文件内容的排序场景
除了内存中的数据,排序也常常用于文件处理。比如一个考勤系统把员工打卡时间逐行写入文件,现在需要按时间排序后重新输出。C语言做法是:读取文件每一行存入数组,对数组排序,再写回文件。这个过程本质上仍然是内存中的排序,但多了文件I/O的处理。
一个常见的性能问题:如果文件非常大(GB级别),把所有内容读入内存就不现实了。这时候要用到外部排序的思路:把大文件切割成若干个小块,每块读入内存排序后写回临时文件,再用归并的思路把多个有序临时文件合并成最终文件。这就是归并排序思想在工程上的直接应用。理解归并排序比只背代码重要得多,因为它真的能在文件排序里派上用场。
6. 常见问题排查:排序代码调不出来怎么办
6.1 数组越界和循环变量错误
排序代码最容易出现的就是数组越界。比如冒泡排序内层循环写成了j < n - i而不是j < n - 1 - i,当j取到需要访问arr[j+1]时,最后一次可能已经访问到arr[n],直接越界。在C语言里,数组越界不一定立刻报错,可能只是读出垃圾数据,表现为排序结果莫名多出奇怪的数字、或者在极端数据下程序崩溃。
这种错误排查起来最费劲的地方在于:小数据量测试时可能恰好没触发越界,数据一多就出错。我的建议是:写排序代码时先想清楚每层循环的边界条件是什么,用一个小例子(比如5个元素)手动走一遍循环,看看i和j的实际取值范围是否合理。
6.2 死循环与递归栈溢出
快速排序和归并排序都是递归结构,死循环通常表现为程序“跑不完”。快排里常见的原因是边界没有收敛,比如递归调用时写了quick_sort(arr, left, i)而不是quick_sort(arr, left, i - 1),导致包含基准值的区间被重复递归,永远无法缩小。还有一种是基准值归位逻辑错误,导致某次划分后左右的元素仍然包含基准值,陷入无限递归。
递归栈溢出通常是因为排序区间没有正确缩小,递归深度超过了系统限制。我遇到过一次,给50000个逆序元素做快排,没加三数取中,直接栈溢出崩溃。排查递归类排序的一个好办法是打印每次递归调用的left和right参数,观察它们是否正常收敛。
6.3 比较函数写反
用qsort时,如果排序结果正好是反的,问题几乎一定出在比较函数上。我经常看到有人把升序和降序的返回值搞混,还反过来怀疑库函数有问题。比较函数里的返回值的决定规则是:返回负数表示第一个参数应该排在第二个参数前面。要升序就if (a < b) return -1;,要降序就把规则反过来。写完之后先用3个元素的小数据测试确认方向,再上大数据。
6.4 验证排序算法正确性的万能手段
排序算法写完之后,我强烈建议不要只用一两组数据验证。正确的验证方式是这样:准备一个随机数组(元素范围大一点),同时调用库函数qsort对同一样本排序,然后把你写的排序结果和qsort的结果逐位比较。如果完全一致,就说明基本没问题。然后加测几组边界数据:空数组、1个元素、全部相同元素、已经有序、完全逆序、包含负数、包含INT_MAX和INT_MIN。一套组合拳下来,正确性基本上能保证。
这个随机对比验证的方法,是我自己学排序时体会最深的一个技巧。它能帮你快速定位代码里那些“看起来对但实际错”的细微bug,比你自己一遍遍肉眼看代码高效得多。
7. 性能测试的心得:数据规模怎么影响选择
学完这些排序算法之后,我被问得最多的问题就是:到底用哪种排序?这个问题离开了数据规模谈,是没有意义的。
我的实际测试数据是这样的:n=10时,冒泡、选择、插入、快排、归并、堆排的耗时全部在微秒级别,肉眼完全感知不到差异,此时最快的反而是代码最简单的插入排序。n=1000时,O(n²)的算法大约需要几万次操作,O(n log n)的算法只需要几千次,但仍然感觉不出区别。n=100000时,差异就开始明显了:插入排序可能要几秒,而快排和归并只需要几十毫秒。n=1000000时,O(n²)的算法已经几乎无法完成,而快排、归并仍然在一秒以内。
这个现象很好地说明了一个道理:算法的好坏不是靠感觉,而是靠渐近复杂度分析。即使小数据下冒泡排序和快速排序看不出差别,一旦数据规模增长,两者的差距是指数级的。这也是为什么面试和竞赛那么看重时间复杂度分析。
如果你在做算法题,例如蓝桥杯或PAT的题目里需要排序,优先使用库函数qsort,而不是手写排序。因为库函数经过深度优化,在绝大多数场景下性能超过手写简单版本。学习手写排序的价值在于理解原理、应对手写要求的场景、以及为后续学习其他算法打基础。
8. 最后分享两个我一直在用的学习技巧
我最后想分享两个帮助我彻底掌握排序算法的技巧,也适用在其他C语言算法的学习里。
第一个技巧是“画图走查法”。拿到一个排序算法,先别急着读代码,用纸笔画出数组的每个状态。冒泡排序画一趟完整的交换过程,快速排序画基准值如何归位。画完之后再对照代码走一遍,哪个变量在哪个时刻等于多少都清清楚楚。这个方法非常费时间,但效果极好。我教过的很多同学,用这种方法之后,面对排序算法就没有再“忘过”。
第二个技巧是“断点打日志法”。程序运行结果不对的时候,不要只盯着代码冥思苦想。在循环体、递归函数入口、交换操作附近打印日志,输出关键变量的值。比如快排里打印每次划分后左右指针的位置,看它是否符合预期。这个习惯能帮你在调试排序算法时节省大量时间。我当年学堆排序的时候,就是靠打印每一步数组状态,才真正理解了下标之间的父子关系。
C语言排序算法的学习,说难也难,说简单也简单。它难在细节多、边界条件繁琐、调试起来不容易;简单在思路本身都不复杂,只要静下心来逐个突破,完全可以在几天内彻底掌握。排序学扎实之后,二叉树、图论、动态规划这些硬骨头都会好啃很多,因为你已经建立了“用算法思维解决问题”的底层框架。希望这篇总结能帮到正在和排序算法“搏斗”的你。
