聊素数算法之前,我先说个我自己踩过的坑。有段时间我刷题,遇到“判断一个数是否是素数”就直接用最朴素的循环从 2 试到 n-1,数据小还好,数据一大就超时;后来遇到“输出 1 到 10^7 的所有素数”,我又习惯性地想逐个判断,结果跑了十几秒还没跑完。那时候我才意识到,素数判断和素数筛法其实是两个完全不同的问题——前者回答“单个数字是不是质数”,后者是“把一批数字里的所有质数一次性全部找出来”。如果你也在这两个名字之间绕得晕,或者只是背了欧拉筛但说不清它比埃氏筛强在哪,那这篇文章应该能帮上忙。
这篇东西我不会只丢代码,我会把试除法、埃氏筛、欧拉筛各自的适用场景、优化动机、复杂度推导、以及我在实际做题时踩过的坑都聊清楚。尤其会讲清楚一个很多人没想明白的点:为什么欧拉筛是 O(n),以及它比埃氏筛“高级”在哪里。文章适合正在学算法的大学生、准备蓝桥杯或 ACM 的选手,也适合工作中偶尔需要写点素数相关逻辑的开发同学。
1. 先理清一个问题:单个数判断和批量筛素数,根本不是一回事
很多人第一次学素数相关算法,都是把“素数判断”“埃氏筛”“欧拉筛”放在一起背的。结果就是:让他判断一个数是不是素数,他先用欧拉筛筛了半天;让他求 1 到 n 的所有素数,他又一个一个去试除。这两种操作看起来都在“找素数”,但其实是两个完全不同的需求,对应的算法思路、复杂度模型、代码写法都完全不同。
1.1 两种需求场景,对应完全不同的解法
第一种需求:判断单个数字是不是素数。比如题目给你一个 n,n 可能大到 10^12,问你它是不是质数。你只需要回答一个问题,不需要关心其他数字。这种场景的解法核心是“试除法”:从 2 开始,逐个检查有没有能整除 n 的数,有就是合数,没有就是素数。
第二种需求:批量求素数。比如题目要你把 [1, 10^7] 范围内的所有素数全部输出,或者给你 m 次询问,每次问 [l, r] 区间内有多少素数。这种场景如果还用试除法,每个数都去试除一遍,那计算量会爆炸。正确的思路是先借助筛法一次性把所有素数标记出来,之后每次查询直接查表,变成 O(1) 的操作。
这俩的区别,就好比“检查某个人是不是小偷”和“把一条街上所有小偷都揪出来”。前者是对单个对象做判断,后者是对整个群体做排查,方法完全不同。
1.2 先看数据范围再选算法,而不是背固定套路
我见过不少初学者喜欢背“模板”,什么题都用同一个算法。这种习惯在题量小的时候没什么问题,但一旦数据范围上来,就会超时或者爆内存。正确做法是拿到题目先看数据范围,再倒推该用什么算法。
| 问题形态 | 数据范围 | 推荐做法 |
|---|---|---|
| 单个数判断 | n <= 10^12 | 优化试除法 |
| 单个数判断 | n <= 10^18 | 试除法太慢,考虑 Miller-Rabin |
| 批量求素数 | n <= 10^6 | 埃氏筛、欧拉筛都行 |
| 批量求素数 | n <= 10^7 | 欧拉筛或埃氏筛 |
| 批量求素数 | n <= 10^8 且内存吃紧 | 埃氏筛 + 只筛奇数 / bitset |
这里要强调一个关键认知:复杂度不是按“绝对快慢”看的,而是要结合题目给的时限和数据范围来选。O(sqrt(n)) 和 O(n log log n) 是两个不同维度的复杂度,一个看的是单个数字的大小,一个看的是范围上限。把它们放在同一个维度里去比较“哪个快”,本身就是误区。
1.3 为什么实战里总是要先筛素数表
如果题目有 m 次询问,每次问 [l, r] 内有多少素数,每次都去试除法判断是不现实的。挨个判断的话,一次询问复杂度就是 O((r-l+1) * sqrt(r)),m 次询问直接爆炸。
正确思路是:先用筛法把 [1, MAX] 的素数表筛出来,然后做一个前缀和数组 prefix[i] 表示“从 1 到 i 有多少个素数”,这样每次查询 [l, r] 的答案就是 prefix[r] - prefix[l-1],一次 O(1) 计算搞定。
这也是为什么“筛法”在竞赛里这么重要的原因——它不只是“把素数找出来”,更是后续很多数论操作的基础。你先把表建好,后面所有查询都变成查表,这才是高效算法的本质。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 试除法:单个数判断的朴素起点与三层优化
试除法是判断单个素数最基础的方法,也是很多人写第一行素数代码的开端。它虽然朴素,但通过三层优化,能在绝大多数单次判断场景里直接胜任。
2.1 从 2 试到 n-1 是新手最常见的超时写法
很多人第一个素数判断函数是这么写的:
python复制def is_prime(n):
for i in range(2, n):
if n % i == 0:
return False
return True
这段代码逻辑没错,但存在明显效率问题。对于 n = 10^12,它要循环约 10^12 次,哪怕现代 CPU 每秒能跑 10^9 次简单运算,也要 1000 秒以上,这显然不可接受。
真正的优化点在于:你根本不需要试到 n-1,只需要试到 sqrt(n) 就足够了。
2.2 为什么只需要检查到 sqrt(n)
一个数如果存在大于 sqrt(n) 的因子,那么必然也存在小于 sqrt(n) 的对应因子,因为因子是成对出现的。
举个例子,12 的因子对是 (2, 6) 和 (3, 4),sqrt(12) 约等于 3.46。你从 2 开始试,试到 3 就已经发现 12 能被 3 整除,可以直接返回“合数”,根本不需要去看后面的 4、6、12。如果 n 是素数,比如 17,从 2 试到 4(sqrt(17) ≈ 4.12),发现都不能整除,就可以断定它是素数了。
写成代码就是:
python复制def is_prime(n):
if n < 2:
return False
i = 2
while i * i <= n:
if n % i == 0:
return False
i += 1
return True
这样循环次数从 n 降到 sqrt(n),对 10^12 级别只需要 10^6 次,瞬间就能跑完。
2.3 循环边界和特殊值的坑
i * i <= n 这个写法在 C++ 里要注意 int 溢出问题。如果 i 和 n 都是 int 型,ii 在计算时可能溢出成负数,导致死循环或者错误结果。我自己就在这上面栽过跟头,尤其是 n 接近 int 上限的时候,i 只要超过 46340,ii 就超过 int 最大值了,直接溢出。
最稳妥的写法是 i <= n / i,用除法代替乘法,既不会溢出,也避免了浮点数误差。在 Python 里没有 int 溢出问题,但为了习惯一致,我建议也写成 i <= n // i 或者用 math.isqrt(n) 提前算好上界。
另外要处理几个特殊值:n = 0、1 都不是素数,n = 2 是唯一的偶素数。这些边界一定要在函数开头就处理掉,否则会出现逻辑漏洞。
2.4 跳过偶数和 6k±1 规则
判断完边界后,可以先排除偶数。除 2 以外的偶数都不可能是素数,所以一进来先检查 n % 2 == 0,如果成立直接返回 False。然后循环从 3 开始,每次加 2,只检查奇数因子,计算量立刻减半。
更进一步,所有大于 3 的素数都满足 6k±1 的形式。为什么?因为任何整数都可以写成 6k、6k+1、6k+2、6k+3、6k+4、6k+5 这六种形式之一。其中 6k、6k+2、6k+4 都是偶数,能被 2 整除;6k+3 能被 3 整除。所以除了 2 和 3 本身,剩下的候选素数只能是 6k+1 或 6k+5 的形式,也就是 6k±1。
利用这个规律,循环步长可以设为 6,每次只检查 i 和 i+2 两个数:
python复制def is_prime(n):
if n < 2:
return False
if n in (2, 3):
return True
if n % 2 == 0 or n % 3 == 0:
return False
i = 5
while i * i <= n:
if n % i == 0 or n % (i + 2) == 0:
return False
i += 6
return True
这样判断一次 10^12 级别的数,实际跑起来大约是微秒级,很多题里都能直接用。当 n 到了 10^18 这个量级,连 sqrt(n) 都是 10^9,试除法就基本没戏了,那时候应该换 Miller-Rabin 这类概率性素性测试。不过主流的算法题里,数据给到 10^12 已经算很大了,上面的优化版本基本都能扛住。
3. 埃氏筛:最朴素的批量筛法,和它的两处关键优化
如果说试除法是“逐个排除”,那埃氏筛就是“批量标记”。它的思路非常简单:准备一张从 2 到 n 的表,默认都是素数;从 2 开始,把 2 的所有倍数标记成合数;然后找到下一个没被标记的数,把它的所有倍数标记成合数。这样一路做下去,最后剩下的就是素数。
3.1 核心思想:把合数一个一个标记掉
埃氏筛的流程可以这样理解:你有一排从 2 开始编号的箱子,每个箱子里放的默认是“素数”。从第一个箱子 2 开始,把它后面所有编号为 2 的倍数的箱子都标记为“合数”。接着找到下一个还是“素数”的箱子,比如 3,再把它后面所有编号为 3 的倍数的箱子标记为“合数”。继续往下走,5、7、11……所有没被标记的数就是素数。
为什么这样做一定能筛出所有素数?因为任意合数一定存在一个小于它本身的质因子,当循环进行到这个质因子时,这个合数必然会被标记掉。比如 49 是合数,质因子是 7,循环到 7 时,49 就会被标记。
python复制def sieve_of_eratosthenes(n):
is_prime = [True] * (n + 1)
is_prime[0] = is_prime[1] = False
for i in range(2, int(n**0.5) + 1):
if is_prime[i]:
for j in range(i * i, n + 1, i):
is_prime[j] = False
return [i for i in range(2, n + 1) if is_prime[i]]
注意外层循环只需要到 sqrt(n),因为更大的素数,它的倍数在 [i*i, n] 范围内,要么还没被标记,要么已经由更小的质因子标记了。
3.2 内层循环为什么从 ii 开始而不是从 2i 开始
这是埃氏筛最容易理解错的地方,也是新手写代码时最常见的“可优化点”。从 2i 开始其实逻辑上也是对的,因为 2i 确实是 i 的倍数,应该被标记。问题在于,这会造成大量重复标记。
举个例子,当 i = 5 时,5×2=10、5×3=15 已经在 i=2、3 时被标记过了,5×4=20 也在 i=2 时被标记过(2×10)。只有当 j = i*i = 25 时,才是第一次出现“这个数之前没有被更小的素数标记过”的倍数。
所以把内层循环起点写在 i*i,能让每一轮只标记“新出现的合数”,减少重复工作量。这个优化很关键,它的效果不是常数级的,而是把复杂度从 O(n log n) 降到了 O(n log log n),实际运行时间能差出好几倍。
3.3 复杂度怎么来的,为什么是 O(n log log n)
埃氏筛的标记总次数大概是这样的:对于每个素数 p,它的倍数有大约 n/p 个,所以总标记次数是 n/2 + n/3 + n/5 + n/7 + n/11 + ……,也就是 n 乘以所有素数倒数之和。
素数倒数之和的增长速度大约等于 log log n。这个结论来自数论里的一个经典结果:所有不超过 n 的素数倒数之和近似为 ln ln n + B(B 是某个常数)。所以总复杂度就是 O(n log log n)。
这个复杂度直观来说,就是比 O(n) 多一点,但比 O(n log n) 少很多。对 10^7 这个级别,n log log n 大约是 2.8×10^7 次操作,和 n 本身差距不到三倍,所以埃氏筛在实际运行中已经非常快了。
3.4 只筛奇数版本:内存和计算量一起减半
如果 n 很大,比如 10^8 甚至 10^9,把所有偶数也存下来就太浪费了。已知 2 是唯一的偶素数,后面只需要考虑奇数,所以可以把数组下标和实际数字做一层映射。
一个很常见的做法是:数组里只存奇数位置,数字 i 存到下标 i//2 的位置。这样数组长度直接减半,内层循环步长也从 i 变成 i*2(因为只标记奇数的倍数)。
python复制def sieve_odd(n):
if n < 2:
return []
is_prime = bytearray(b'\x01') * ((n // 2) + 1)
is_prime[0] = 0 # 数字 1 不是素数
primes = [2]
limit = int(n**0.5)
for i in range(3, limit + 1, 2):
if is_prime[i >> 1]:
for j in range(i * i, n + 1, i * 2):
is_prime[j >> 1] = 0
primes.extend(i for i in range(3, n + 1, 2) if is_prime[i >> 1])
return primes
这里我用的是 bytearray 而不是 Python 的 list。有个重要的细节:Python 的 [True] * (n+1) 其实是一个对象引用数组,每个元素占用 8 字节,10^8 个元素就是 800MB,直接爆内存。而 bytearray 每个元素只占 1 字节,10^8 个才 100MB,只存奇数再减半,大概 50MB,这才适合拿来筛大数据范围。
如果是 C++,bool 数组是 1 字节,10^8 是 100MB,很多 OJ 能过但偏紧。更进一步可以用 bitset,10^8 位大概是 12.5MB,内存非常宽裕,但代码可读性会下降,一般题用不上。
4. 欧拉筛:让每个合数只被筛一次
埃氏筛看起来已经很优秀了,但它的名字里其实藏着一个短板:同一个合数可能被多个质因子重复标记。比如 12,循环到 2 时被标记一次(2×6),循环到 3 时又被标记一次(3×4)。这种重复在数据范围变大后会累积成明显的性能损耗。
欧拉筛,也叫线性筛,就是冲着“每个合数只被筛一次”这个目标去的。它的核心思路是:每个合数只被它的最小质因子筛掉,从而把总操作次数严格压到 O(n)。
4.1 埃氏筛到底浪费在哪:12 被筛了两次
拿 12 举例。埃氏筛处理到 i=2 时,会将 4、6、8、10、12……这些 2 的倍数全部标记;处理到 i=3 时,又会将 6、9、12、15……这些 3 的倍数全部标记。于是 12 在 i=2 和 i=3 这两轮各被标记了一次。
合数越多,这种重复越明显。粗略估计,埃氏筛总标记次数约为 n log log n,而 1 到 n 之间的合数只有大约 n 个。也就是说,实际标记次数比必要的 n 次多出了快两倍。这个冗余虽然不会改变复杂度量级,但确实存在不小的常数开销。
欧拉筛的思路就是把这些冗余全部去掉:给每个合数指定一个唯一的“筛除者”——它的最小质因子。合数 12 只在“最小质因子 2 × 6”这一种组合下被标记,不会被 3×4 再标记一次。
4.2 核心代码:为什么 if i % p == 0 就要 break
先看欧拉筛的标准实现:
python复制def sieve_linear(n):
is_prime = [True] * (n + 1)
is_prime[0] = is_prime[1] = False
primes = []
for i in range(2, n + 1):
if is_prime[i]:
primes.append(i)
for p in primes:
if i * p > n:
break
is_prime[i * p] = False
if i % p == 0:
break
return primes
这段代码里最关键、也最让人难懂的是 if i % p == 0: break。我当年学的时候也是卡在这一行,想了很久才彻底想明白。
要理解它,先要记住目标:每个合数只被“它的最小质因子 × 某个数”筛掉一次。假设当前遍历到 i,正在依次尝试用素数 p 去筛 i*p。如果 p 能整除 i,说明 p 是 i 的最小质因子。为什么?因为 primes 列表里的素数是按从小到大依次尝试的,第一个能整除 i 的 p,必然是 i 的最小质因子。
这时候,如果继续用后面更大的质因子 q 去筛 iq,iq 这个合数的最小质因子其实是 p 而不是 q。原因很简单:i 本身含有因子 p,所以 iq 一定能写成 p × (i/p × q),而且 p < q,所以 p 才是它的最小质因子。既然 iq 应该由更小的 p 来筛,那现在用 q 去筛它就违背了“只被最小质因子筛掉”的原则,而且会造成重复标记。所以这时候直接 break,停止用更大的 q 去筛。
反过来,当 i % p != 0 时,p 不是 i 的因子,ip 的最小质因子就是 p 本身(因为 i 的所有质因子都大于 p,或者根本没有小于 p 的质因子)。用 p 去筛 ip,完全符合规则。
4.3 为什么整体复杂度是 O(n)
想证明欧拉筛是 O(n),可以抓住“每个合数只被标记一次”这一点来分析。
对于任意合数 x,设它的最小质因子是 p。那么 x 一定等于 p × (x/p)。注意 x/p 这个数,它的最小质因子一定大于等于 p,因此当外层循环遍历到 i = x/p 时,内层循环遍历 primes 列表,会在 p 这个位置将 i*p = x 标记为合数。
关键在于,这个标记过程只发生一次。因为在遍历到 p 之前,x 不会被更小的素数标记——更小的素数不是 x 的质因子,也就不会在 i = x/p 这一轮被当作 p 来筛;在遍历到 p 之后,由于 p 是 x/p 的因子,也就是此时 i % p == 0 成立,循环会立即 break,后面更大的素数不会再用更大的 q 去标记 x。
所以每个合数只被标记一次。外层循环每个 i 最多执行一轮内层循环,虽然内层循环本身长度为素数个数,但一旦进入 break 就会提前终止,总执行次数不超过 n 加上合数个数,也就是 O(n)。
4.4 欧拉筛的进阶玩法:同时求欧拉函数和莫比乌斯函数
欧拉筛更大的价值在于,“每个合数被最小质因子筛一次”这个过程,天然适合在筛的同时计算积性函数。以欧拉函数 φ(n) 为例,φ(n) 表示 1 到 n 中与 n 互质的数的个数。
素数 p 的欧拉函数是 p-1;对于合数 i×p,分两种情况:
- 如果 p 不整除 i,那么 φ(i×p) = φ(i) × φ(p) = φ(i) × (p-1);
- 如果 p 整除 i,说明 p 是 i 的质因子,这时 φ(i×p) = φ(i) × p。
这两条恰好对应欧拉筛内层循环的 if/else 分支:
python复制def sieve_with_phi(n):
is_prime = [True] * (n + 1)
is_prime[0] = is_prime[1] = False
primes = []
phi = [0] * (n + 1)
phi[1] = 1
for i in range(2, n + 1):
if is_prime[i]:
primes.append(i)
phi[i] = i - 1
for p in primes:
if i * p > n:
break
is_prime[i * p] = False
if i % p == 0:
phi[i * p] = phi[i] * p
break
else:
phi[i * p] = phi[i] * (p - 1)
return primes, phi
莫比乌斯函数 μ 也可以用类似的递推方式求出。所以实际做数论题时,只要记住欧拉筛的框架,一套代码就能把素数表、phi、mu 全部算出来,非常省事。这也是为什么欧拉筛在数论题里几乎是标配工具。
5. 实测对比与选型建议:什么情况下用谁
5.1 1e7 和 1e8 的实测感受
我在本地用 C++ 跑过几个版本,大致感受是这样的:
| 数据范围 | 埃氏筛(基础版) | 埃氏筛(只筛奇数) | 欧拉筛 |
|---|---|---|---|
| 1e7 | 约 30ms | 约 15ms | 约 25ms |
| 1e8 | 约 400ms | 约 180ms | 约 350ms |
这里要说清楚:这只是我本机的实测感受,跟编译器、CPU、内存带宽都有关系,不要当作精确性能数据。但从趋势上能看到一个有意思的现象:埃氏筛如果做了只筛奇数优化,实际跑起来可能不输甚至反超欧拉筛,因为欧拉筛的内层循环里多了一次取模和分支判断,指令数并不少。
所以不要迷信“欧拉筛一定更快”。它的优点主要在“确定性的 O(n) 复杂度”和“能顺带算积性函数”,而不在于常数一定最小。相反,埃氏筛的代码更简单,配合只筛奇数优化,在很多场景下其实是更实用的选择。
5.2 我实际写题时的选型逻辑
根据不同的题目条件,我一般按照下面的逻辑选择:
- 只需要判断一个数,n 在 10^12 以内:直接优化试除法,简单可靠;
- 需要筛出 [1, 10^7] 内素数,只求素数表:埃氏筛或欧拉筛都行,看自己哪个写得熟;
- 数据范围顶着 10^8 甚至更大,内存吃紧:埃氏筛 + 只筛奇数 / bitset,内存和常数都能压下来;
- 需要同时筛素数、欧拉函数、莫比乌斯函数:直接欧拉筛,一套代码全搞定。
很多情况下,好的做法并不是“选最强算法”,而是“选最不容易写错的算法”。比如只求素数个数,埃氏筛改写成标记数组的写法非常直观,就算面试手写也不容易出 bug。欧拉筛虽然理论性能好,但 break 条件写错或者数组越界的问题,一旦出现就很难查。
5.3 几个写代码时必须注意的小习惯
最后写点代码层面的细节吧。
C++ 里尽量用 vector<char> 而不是 vector<bool>。vector<bool> 是位压缩的,内存省但处理起来慢,而且它返回的是代理对象,有些场景容易出坑,比如取地址、绑定引用都会有问题。Java 里可以用 boolean[],要注意默认值是 false。
Python 筛大范围素数建议用 bytearray 而不是 [True] * (n+1)。前面说过,Python list 存的是对象引用,不是真正的 bool 值,8 字节一个元素,几千万以上的范围内存就扛不住了。bytearray 每个元素只占 1 字节,而且可以直接用赋值 0/1 来标记,速度也快不少。
任何时候都要记得处理 n < 2 的情况。判断素数的函数里,n=0、1 都是 False;筛法里,is_prime[0]、is_prime[1] 必须显式置为 False。很多边界 bug 都出在这,我自己写代码的时候每次都先确认这两个下标。
5.4 手工模拟 30 以内的筛选,胜过看十篇教程
最后分享一个我自己的学习方法:学筛法时,随手取 n = 30 这种小范围,把每一步筛掉哪些数手写一遍。
埃氏筛从 2 开始,标记 4、6、8、10……;从 3 开始,标记 6、9、12……;这时候你就会注意到 6、12、18 这些数被重复标记了。然后再手推欧拉筛:i=2 时筛 4,break;i=3 时先筛 6,然后 9,然后因为 3 能整除 3,break;i=4 时先筛 8,然后因为 4 能被 2 整除,break……
写完一遍,你会非常直观地理解“每个合数只被最小质因子筛一次”到底是什么意思。比看十篇教程都管用。想通了这一步,后面的欧拉函数、莫比乌斯函数递推,也都顺理成章了。
