不想让查询把主库拖垮,又怕备库报表半夜报错——这大概是所有做过ADG读写分离的DBA都经历过的纠结。而这里面最常见的拦路虎,就是ORA-01555: snapshot too old,快照过旧。这个错误在单机或主库上出现,大家多少还有排查思路,但一旦发生在ADG备库的只读查询上,很多人会直接懵掉:备库又没有业务写入,哪来的UNDO压力?为什么快照还能过期?
这篇内容,我结合自己处理过的几个生产案例,把ADG只读查询场景下ORA-01555的成因、排查方法和UNDO优化方案一次讲透。无论是刚接手ADG环境的新手,还是被这个问题折磨过的老手,这篇都能给你一些可落地的思路。
1. ORA-01555在ADG备库上的特殊成因
1.1 备库不是”没有UNDO“,而是UNDO不受备库控制
很多DBA的第一反应是:备库是只读的,理论上不会产生新事务,那UNDO为什么要被覆盖?这个问题问到点子上了,也是理解整件事的钥匙。
我们平时在主库上执行一个长查询,Oracle会通过UNDO表空间里的前镜像(undo image)来构建一致性读(CR)块。只要查询开始时的SCN对应的UNDO数据还在,就能读到一致性的历史版本。如果查询需要回看的数据块被修改了太多次,或者UNDO被新事务覆盖了,就会报ORA-01555。
ADG备库的情况就和主库很不一样,它本身不产生UNDO,但它需要从主库接收的redo日志中解析并应用事务。这里必须说清楚的逻辑是:备库上的UNDO数据,本质上是主库UNDO段在redo里的事务映像在备库端的实时回放。备库上的UNDO表空间确实是独立的物理文件,但内容完全由主库的redo驱动,备库自身的进程没有权限去控制UNDO段的保留、清理和覆盖时机。
这意味着什么?意味着你的备库虽然看起来风平浪静没有写入,但备库的UNDO段里正在持续进行着“扩展-覆盖-回收”的循环。这个过程的主控权,在主库上。
继续深入一点,备库应用redo的时候,会模拟主库的UNDO段活动。当主库上某个UNDO段中的事务提交并超过保留期后,主库会把这段UNDO空间标记为可复用,后续新事务会覆盖它。备库端同步执行同样的动作。如果你的备库上刚好有一笔很长的只读查询,其查询SCN对应的UNDO信息在主库端已经被判定为“过期”并被覆盖,那备库的查询在尝试构建CR块时,就会发现找不到需要的前镜像——ORA-01555就此产生。
这里有一个极其重要的推论:备库报ORA-01555,问题的根源几乎总在主库的事务量、UNDO保留策略和备库查询时长之间的三角关系上。单纯在备库上做任何UNDO调整,都是治标不治本,甚至毫无效果。
1.2 什么场景下最容易触发备库快照过旧
从我接触过的生产环境看,ADG备库出现ORA-01555往往有比较明显的场景特征,我列出来供你对号入座:
第一类,也是最高发的场景:备库承担大量报表查询、统计任务、数据抽取。这类查询经常要扫描大表,执行时间动辄几十分钟甚至数小时。如果主库的业务事务又很密集,UNDO段被快速覆盖,那报表查询跑到后半段就很容易撞上快照过旧。我处理过的一个客户案例里,备库上有个统计SQL要跑将近50分钟,主库的UNDO表空间有200G,保留时间设了180分钟,看似绰绰有余,但仍然间歇性报01555。问题恰恰出在UNDO表空间频繁自动扩展又收缩,导致部分UNDO段的状态不够健康。
第二类是主备之间redo传输有延迟的场景,尤其是使用了SYNC模式以外的方式时。备库的redo apply如果跟不上主库的生成速度,备库上的数据SCN会持续滞后。这种滞后会带来一个很奇怪的现象:备库查询明明没有跑太久,但因为数据一直没追上主库,查询看到的SCN区间跨度被拉长了。一旦某个时刻redo追平,UNDO应用瞬间集中释放,刚好和长查询构成竞争,就会触发01555。
第三类是UNDO表空间配置不合理。很多人会认为,备库只读不写,UNDO表空间不需要太大,随便给个10G甚至5G就完事了。这就是备库01555比主库更频繁的隐形推手。因为主库的UNDO可能配置得当,但备库端如果做的是物理备库,它的UNDO表空间大小是继承主库配置的,如果在配置ADG时手动调整过备库UNDO大小,就很容易出现备库UNDO不足、过早覆盖的情况。
还有一类容易被忽略的情况:使用了基于undo_retention的参数调优,但对Oracle 12c之后的PDB架构下UNDO配置变化不了解。如果你用的是多租户架构,UNDO管理模式和相关参数的行为会有差异,这个后面细说。
1.3 ADG查询与主库查询的一致性机制差异
这里再往深挖一层,为什么同一个SQL,应用在主库上不报01555,切到ADG备库就报?这背后的机制差异才是吃透问题的关键。
主库上执行查询时,查询进程直接访问当前的数据块和UNDO段。如果需要老版本的数据,数据库从UNDO段读取前镜像即可。整个过程是“本地实时”的,数据块只要没有被覆盖,就永远可以访问到对应SCN的历史版本。
备库的情况截然不同,它是通过redo日志来回放主库的每一个数据块变更。假设备库查询开始时的SCN是A,查询要读取的数据块在前一秒刚被主库以更高的SCN更新了。备库端为了保证读一致性,需要回到SCN A的状态,这时它就必须去UNDO段找被覆盖前的版本。但是等等——这个过程其实比看上去复杂得多。备库本身的数据块可能已经被redo apply推进到比SCN A更新的状态,而备库端UNDO段中属于SCN A时的数据,需要被保留备查。这里就涉及到一个我称之为“低水位SCN被持续抬高”的问题。
什么是低水位SCN?简单说就是数据库中所有活动事务和保留UNDO所能覆盖到的最早SCN。主库上只要存在一个长事务,或设置了足够的UNDO保留时间,低水位SCN就会被压住不动。但在备库上,UNDO段的保留完全跟随主库的commit和undo_retention策略,不会因为备库上存在长查询就去专门保留哪一段历史版本。备库上的长查询,在Oracle内部并不会有任何机制去“保护”它所需的UNDO不被覆盖。备库是单纯的回放者,不是决策者。
这就是为什么同一个SQL,在主库上优化好UNDO参数后跑得稳稳当当,一放到备库上就时不时给你报个01555——它的UNDO生命周期,压根就不由你的备库查询说了算。理解了这一点,后面的优化方向就顺理成章了:你的核心手段,一定都要围绕如何让主库保留更久的UNDO历史版本,以及如何缩短备库查询所需的历史版本跨度来展开。
先说结论,避免信息过载:
| 关键因素 | 主库查询 | ADG备库查询 |
|---|---|---|
| UNDO来源 | 本地UNDO段,查询可直接读取 | 回放主库redo生成,受主库控制 |
| 低水位SCN | 可由长事务和参数主动保护 | 跟随主库UNDO段的覆盖节奏 |
| 是否受undo_retention保护 | 是 | 延后生效,有滞后性 |
| ORA-01555优化入口 | 本地UNDO管理直接调优 | 优化主库UNDO+优化备库查询时长 |
| 数据块访问 | 直接访问当前块+CU(当前读) | 访问已应用redo的块+CR(一致性读) |
接下来,我会把每一类优化手段和踩坑点完整展开。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. UNDO参数调优与优化方案
2.1 UNDO表空间大小与undo_retention的配置逻辑
既然已经知道ADG备库的UNDO行为跟着主库走,那第一层的优化思路就很清晰了:在主库上把所有影响UNDO保留能力的参数配置调到合理水位,尤其是UNDO表空间大小和undo_retention之间的配合关系。
关于undo_retention,一个常见的错误是认为把它设得越大越好。我见过有人直接设成28800分钟,也就是20天,结果UNDO表空间疯狂膨胀,几乎撑满了磁盘。追求极端保留时间的目标是好的,但忽略了Oracle的一个内部机制:undo_retention只是一个“期望值”,在UNDO空间富余时,Oracle会尽量保留超过这个时限的数据,并不强制覆盖;但如果UNDO表空间不足,即使没到保留时限,Oracle也会自动覆盖最老的UNDO区,优先保证新事务能正常运行。换句话说,你要想让undo_retention真正生效,前提是UNDO表空间要留出足够余量。
这就引出了一个生产上常用的配比思路。你可以通过查询v$undostat视图中的maxquerylen列得到当前实例上出现过的最长查询时长(单位是秒),然后按这个经验公式去倒推:
sql复制-- 查看历史上最长查询时长(秒)
SELECT TO_CHAR(BEGIN_TIME, 'YYYY-MM-DD HH24:MI') AS BEGIN_TIME,
MAXQUERYLEN,
MAXQUERYSQLID,
TUNED_UNDORETENTION
FROM V$UNDOSTAT
WHERE BEGIN_TIME > SYSDATE - 7
ORDER BY MAXQUERYLEN DESC;
TUNED_UNDORETENTION列是Oracle根据运行情况自动计算的推荐UNDO保留时长,它的算法大概是在maxquerylen基础上加上一定的冗余,同时考虑UNDO表空间大小和当前使用率。如果你的实际设置明显低于TUNED_UNDORETENTION,那就意味着在当前压力下,undo_retention设置偏低了。
具体的配置方法如下:
sql复制-- 查看当前UNDO参数
SHOW PARAMETER UNDO;
-- 建议配置(单位:秒)
ALTER SYSTEM SET UNDO_RETENTION = 5400 SCOPE=BOTH; -- 90分钟,视长查询情况调整
-- 设置UNDO表空间自动扩展(底线保障)
ALTER DATABASE DATAFILE '/path/to/undotbs01.dbf' AUTOEXTEND ON NEXT 1G MAXSIZE 200G;
至于UNDO表空间该给多大,我提供一个实战测算逻辑而不是空泛的数字。你可以先连续观察一周,通过以下SQL拿到高峰时段的UNDO使用峰值:
sql复制SELECT TO_CHAR(BEGIN_TIME, 'YYYY-MM-DD HH24:MI') AS TIME_SLOT,
SUM(UNDOBLKS) * (SELECT VALUE / 1024 FROM V$PARAMETER WHERE NAME = 'DB_BLOCK_SIZE') / 1024 AS UNDO_MB_USED
FROM V$UNDOSTAT
WHERE BEGIN_TIME > SYSDATE - 7
GROUP BY TO_CHAR(BEGIN_TIME, 'YYYY-MM-DD HH24:MI')
ORDER BY 2 DESC
FETCH FIRST 20 ROWS ONLY;
拿到的峰值MB数建议乘以2到3倍,作为UNDO表空间的目标大小。为什么要留这么大的余量?因为UNDO分配是动态的,某些批量任务会产生瞬时UNDO飙升,如果空间不够触发了自动扩展,在扩展过程中又出现了UNDO覆盖,等于空间给了但保留逻辑垮了,仍然会报01555。留足空间余量,让UNDO段始终处于“有人排队但没人抢”的状态,才是正确姿势。
2.2 启用UNDO表空间的RETENTION GUARANTEE特性
如果说undo_retention和表空间大小是常规操作,那RETENTION GUARANTEE这个特性就是对付备库ORA-01555的一个特殊武器。它的作用非常直接:强制Oracle即使在新事务需要UNDO空间时,也绝对不能覆盖未过保留期的UNDO数据。宁肯新事务报“ORA-30036: unable to extend segment by ... in undo tablespace”,也不能让老UNDO被提前销毁。
这个参数对ADG备库长查询场景的价值在于:备库因为应用redo,它端上的UNDO覆盖时机可能比主库略微滞后,但并不保险。如果你在主库上开了RETENTION GUARANTEE,主库的UNDO段在任何情况下都会坚持保留到undo_retention时限,备库回放redo时自然也继承了这种“强制保留”的语义——这相当于给备库的长查询加了一道保险。
启用方法很简单:
sql复制ALTER TABLESPACE UNDOTBS1 RETENTION GUARANTEE;
但要提醒的是,RETENTION GUARANTEE是一把双刃剑。开了之后,一旦UNDO使用量达到表空间上限且仍有事务需要分配UNDO,新事务会直接失败而不是覆盖旧数据,这对主库的业务影响远比备库报个01555严重得多。所以在正式环境开启这个特性前,必须确保UNDO表空间足够大,并加上自动扩展作为兜底,同时持续监控UNDO使用率。
我的建议是:如果你的备库长查询很关键且频繁,且主库的UNDO表空间已经按2到3倍峰值完成了扩容,可以开RETENTION GUARANTEE。如果条件不具备,不要盲目开,优先通过给足表空间的方式来解决。
2.3 关于UNDO参数的“为什么”详解
这块我想多说几句原理层面的东西,因为只告诉你怎么设参数而不解释为什么,很容易在遇到新场景时抓瞎。
先讲cleanout和延迟块清理,因为这是很多UNDO问题的隐身后台。在Oracle中,当一个事务提交时,它修改的数据块并不会全部被立刻清理干净。尤其是大事务,如果涉及的数据块非常多,事务提交时只会把当前正在处理的少数块标记为已提交,其他块留在一种“脏”状态,等后续访问时再做清理,这就叫延迟块清理。
延迟块清理会给备库查询带来什么影响呢?备库上某个数据块可能已经被redo apply推进到了SCN B的状态,块上还残留着未清理的事务信息。你的备库查询要从SCN A开始一致性读,发现目标块当前SCN比A新,就需要通过UNDO去回滚到SCN A。这时备库需要先从块上的事务槽(ITL)中获取事务信息,再到UNDO段去找对应的前镜像。如果这期间该UNDO区刚好被覆盖了,01555就出现了。从这个机制可以看到,备库的01555往往和数据块的活动热点高度相关——被频繁更新的大表,在备库端被长查询触碰时,风险最大。
另一个概念是SCN与水位的推进。主库并不会为备库的存在而放慢SCN推进速度,每产生一个新的提交,全局SCN就向前推进一次。备库应用redo的延迟越长,备库上数据的“新鲜度”越低。但备库查询启动时的SCN,是查询发起那一刻的备库当前SCN;如果查询要扫描的数据块在此后被redo推进得很快,那就需要构建更多的CR版本,对UNDO的消耗也越大。这进一步说明了为什么在备库上做优化,总绕不开“减少查询时间”这个维度。
这里补充说明一下,UNDO段本身还有extent重用和wrap-around的机制。当你看到v$undostat中active和expired状态的块变化剧烈时,往往意味着UNDO段在频繁地分配新extent,这是好事,说明保留充足;如果老是看到同一组extent在反复覆盖,说明UNDO空间吃紧,01555可能马上就会来敲门。
2.4 快速检查脚本,判断你的UNDO配置是否安全
这里分享一个我自己生产环境日常巡检用的脚本,可以直接跑,帮你在问题发生前判断UNDO配置是否存在隐患:
sql复制-- 检查1:UNDO表空间大小、使用率、自动扩展状态
SELECT TABLESPACE_NAME,
ROUND(SUM(BYTES) / 1024 / 1024 / 1024, 2) AS SIZE_GB,
ROUND(SUM(MAXBYTES) / 1024 / 1024 / 1024, 2) AS MAXSIZE_GB,
SUM(CASE WHEN AUTOEXTENSIBLE = 'YES' THEN 1 ELSE 0 END) AS AUTOEXTEND_CNT
FROM DBA_DATA_FILES
WHERE TABLESPACE_NAME IN (SELECT TABLESPACE_NAME FROM DBA_TABLESPACES WHERE CONTENTS = 'UNDO')
GROUP BY TABLESPACE_NAME;
-- 检查2:当前UNDO保留期设置 vs 自动调优后的推荐值
SELECT NAME, VALUE FROM V$PARAMETER WHERE NAME = 'undo_retention';
SELECT TO_CHAR(BEGIN_TIME, 'YYYY-MM-DD HH24:MI') AS BEGIN_TIME,
MAXQUERYLEN,
TUNED_UNDORETENTION
FROM V$UNDOSTAT
WHERE BEGIN_TIME = (SELECT MAX(BEGIN_TIME) FROM V$UNDOSTAT);
-- 检查3:UNDO表空间是否启用了RETENTION GUARANTEE
SELECT TABLESPACE_NAME, RETENTION
FROM DBA_TABLESPACES
WHERE CONTENTS = 'UNDO';
-- 检查4:最近一周内是否有ORA-01555记录
SELECT TO_CHAR(COMPLETION_TIME, 'YYYY-MM-DD HH24:MI') AS COMP_TIME,
INST_ID,
ERROR_NUMBER,
MESSAGE
FROM V$DIAG_ALERT_EXT
WHERE ERROR_NUMBER = 1555
AND COMPLETION_TIME > SYSDATE - 7
ORDER BY COMPLETION_TIME DESC;
3. 备库查询层面的优化手段
3.1 开启备库的_minimum_giga_scn参数来限制UNDO回看范围
讲完了主库侧的UNDO配置,接下来看备库自身能做什么。虽然备库不能直接控制UNDO的保留,但Oracle提供了一个隐藏参数,专门用于优化ADG备库在长查询场景下的UNDO使用行为:_minimum_giga_scn。
这个参数的作用是设置备库最低可用的SCN阈值(单位是十亿)。一旦备库上的查询启动SCN低于这个阈值,Oracle会主动做一次“当前读”而不是“一致性读”,也就是说,查询不再试图通过UNDO去构建老版本数据块,而是直接读取当前数据。这样做的结果是:备库长查询不再需要依赖老UNDO来构建历史版本,从根本上绕开了ORA-01555的触发条件。
这个参数的设计很有意思,它背后的逻辑是:在ADG读写分离场景下,备库上的查询往往允许读到稍旧的数据,不一定需要严格的读一致性和当前数据完全一致。如果你能接受备库查询结果集在查询过程中可能混入少量“提交较晚但SCN较早”的数据(实际上这种差异窗口极小),那这个参数就是一个极其高效的优化器。
设置方法如下:
sql复制-- 在备库上设置(需重启备库实例生效)
SQL> ALTER SYSTEM SET "_MINIMUM_GIGA_SCN" = 263 SCOPE=SPFILE;
-- 查询当前SCN,确认你设置的阈值比当前SCN小合适量级
SQL> SELECT CURRENT_SCN, ROUND(CURRENT_SCN / 1000000000) AS GIGA_SCN FROM V$DATABASE;
-- 通常建议设置为当前SCN对应的十亿位数再减去一定的缓冲值
-- 例如当前SCN是263,548,123,100,则设置263即可
这里需要特别强调:_minimum_giga_scn是隐藏参数,意味着Oracle官方并不提供完整文档支持,使用前必须在测试环境充分验证。而且不同版本(11g、12c、19c)对这个参数的行为细节可能略有差异。生产环境使用时,我建议分两步走:第一步先设置一个比当前SCN小5到10的值,观察备库查询的01555报错频率;如果效果不明显再逐步调高,直到找到既能避免报错又能保持数据可接受度的临界值。
再补充一个实践心得:这个参数配合ADG的实时查询特性,对查询结果的“一致性”影响,大多数报表类应用完全能接受,但如果备库承担的核心业务查询对数据的实时性和一致性有硬性要求,建议谨慎评估后再启用。另外,在Oracle 19c中,这个参数还能配合一个名为“ADR自动熔断”的机制,如果发现设置的阈值导致数据可见性异常,可以更快地感知和回退。
3.2 为关键查询单独设置UNDO保留提示
除了隐藏参数外,还有一个更精细的做法:使用Oracle的UNDO提示(hint)来为特定查询延长UNDO保留期。这里说的不是常规的APPEND之类的hint,而是通过DBMS_APPLICATION_INFO或设置事务属性来影响查询的UNDO行为。
Oracle 12c以上版本中,你可以用以下方式为会话设置较长的UNDO保留:
sql复制-- 在备库会话中设置
BEGIN
DBMS_UNDO_ADV.SET_RETENTION(10800); -- 单位秒,这里是3小时
END;
/
不过坦率地说,DBMS_UNDO_ADV.SET_RETENTION主要影响的是当前实例的UNDO管理策略,在ADG备库上执行时,由于备库自身不生成UNDO,它的实际效果要比主库弱很多。所以对于备库的长查询,我更推荐另外两种更直接的会话级优化手段。
第一种是查询级别的并行度控制。备库长查询之所以跑得久,很大一部分情况是因为扫描的数据量太大。你可以给这些查询设置合理的并行度,缩短查询的总执行时间,直接降低UNDO快照过旧的时间窗口:
sql复制SELECT /*+ PARALLEL(4) */ COUNT(*)
FROM LARGE_TABLE
WHERE CREATE_DATE >= SYSDATE - 1;
第二种是明确告诉优化器走一致性读代价更小的执行计划。比如使用hint强制索引快速全扫描,减少物理读和一致性读的块数。这里要说明:一致性读块数越少,需要回看UNDO的次数就越低,01555的风险自然就下来了:
sql复制SELECT /*+ INDEX_FFS(T IDX_CREATE_DATE) */ COUNT(*)
FROM LARGE_TABLE T
WHERE CREATE_DATE >= SYSDATE - 1;
3.3 时间维度优化:把长查询切成短片段
如果查询本身无法避免扫描大量数据,另一个行之有效的思路是把一段长查询拆成多段短查询。这个方案对业务改造有一定要求,但效果立竿见影。
举个例子,备库上有个统计SQL要扫描全表近5亿行数据,跑完要40分钟,经常在最后10分钟报01555。我们的处理方式是把它改造成按月份分段统计:
sql复制-- 原始长查询
SELECT DEPT_ID, COUNT(*)
FROM ORDERS
WHERE ORDER_DATE BETWEEN DATE '2024-01-01' AND DATE '2024-12-31'
GROUP BY DEPT_ID;
-- 拆分后,按月循环执行,每次查询独立性更强
BEGIN
FOR MONTH_IDX IN 1..12 LOOP
INSERT INTO DEPT_ORDER_STAT (STAT_MONTH, DEPT_ID, CNT)
SELECT MONTH_IDX, DEPT_ID, COUNT(*)
FROM ORDERS
WHERE ORDER_DATE >= TRUNC(TO_DATE('2024-01-01', 'YYYY-MM-DD'), 'MM')
+ NUMTOYMINTERVAL(MONTH_IDX - 1, 'MONTH')
AND ORDER_DATE < TRUNC(TO_DATE('2024-01-01', 'YYYY-MM-DD'), 'MM')
+ NUMTOYMINTERVAL(MONTH_IDX, 'MONTH')
GROUP BY DEPT_ID;
COMMIT;
END LOOP;
END;
/
每个分段的查询时间降到了3-5分钟,UNDO时间窗口从40分钟缩到5分钟以内,01555的触发概率直接降低了一个数量级。同时每个分段的执行计划更容易被优化器精准生成,整体性能甚至比原长查询还好一些。
在改造过程中,有两点需要注意。第一,拆分的粒度要控制在单个查询3到5分钟内完成为宜,太短会增加循环开销,太长则失去分段意义;第二,如果业务查询涉及全局聚合或需要跨分段去重,分段统计后需要额外的汇总步骤,这个逻辑设计要在拆分前考虑清楚。
4. 实操案例:一次典型的备库ORA-01555排查与修复
4.1 故障现场与快速定位判断
去年处理过一个保险行业客户的案例,场景很典型。他们的系统采用Oracle 19c ADG架构,备库专门承担费率和保单的统计查询。某个季度末跑批量报表时,备库频繁报ORA-01555,每天少则两三次,多则七八次,导致报表任务中断,业务部门抱怨很大。
我接手时先做了三件事。第一,查告警日志,确认报错发生的准确时间和频率;第二,在报错时间点前后查询v$undostat,看UNDO的保留时长和查询长度;第三,定位具体是哪个SQL在报错。
第一轮快速定位SQL:
sql复制SELECT TO_CHAR(SAMPLE_TIME, 'YYYY-MM-DD HH24:MI:SS') AS SAMPLE_TIME,
SQL_ID,
SQL_EXEC_START,
SQL_EXEC_ID,
ERROR_NUMBER,
ERROR_MESSAGE
FROM V$ACTIVE_SESSION_HISTORY
WHERE ERROR_NUMBER = 1555
AND SAMPLE_TIME > SYSDATE - 3
ORDER BY SAMPLE_TIME DESC;
查到的问题SQL是备库上一张保单明细大表的全表扫描聚合查询,单次执行在35到50分钟不等。
接着看了UNDO的关键指标。主库的UNDO表空间是60G,AUTOEXTEND ON,MAXSIZE 80G,undo_retention设置的是7200秒(2小时)——表面上看起来挺安全。但细看v$undostat后发现几个重要线索:第一,业务高峰时段maxquerylen在1900秒左右,也就是说出现过约32分钟的长查询;第二,tuned_undoretention推荐值经常跳到9000秒以上,是实际设置值的1.25倍多;第三,UNDO表空间虽然总容量60G,但使用率在高峰时段能冲到80%以上,按这个使用率,即使有autoextend,2小时的保留期也会被挤占。
到这里,根因其实已经清楚了:主库的业务压力大,UNDO空间虽然没有爆,但保留期的安全边际太小。备库的报表查询又要跑快一个小时,这就等于是在刀尖上跳舞:只要哪一刻主库的UNDO使用率一冲高,把老UNDO覆盖掉,备库的长查询立马遭殃。
4.2 从现象到根因的层层分析路径
在确定解决方案前,我还做了一层更深的排查,主要是为了排除其他干扰因素,避免优化后问题依旧。具体排查了以下几方面:
第一步,检查备库的redo apply是否滞后。使用了以下SQL查询备库的apply lag:
sql复制SELECT NAME, VALUE, UNIT, TIME_COMPUTED
FROM V$DATAGUARD_STATS
WHERE NAME LIKE '%lag%';
看到apply lag稳定在1秒以内,说明备库回放实时性很好,可以排除redo延迟导致的SCN跨度异常问题。
第二步,检查出问题SQL的执行计划,排除全表扫描之外是否还有异常的大驱动、低效的hash join。从执行计划看,大表T_POLICY_DETAIL的扫描占了绝大部分成本,虽然表的统计信息比较新,但仍走了全表扫描。结合这个表的数据量在季度末暴增(从2亿行涨到4亿行左右),单次查询时间有较大波动也合情理。
第三步,查热点数据块的UNDO活动。通过v$segment_statistics找出UNDO段中那些被高频覆盖的对象,发现主要是T_POLICY_DETAIL相关的表数据在被频繁更新,进一步确认了01555集中在保单数据上的原因。
分析完之后,问题全貌已经非常立体:主库UNDO空间余量不足导致保留期名不副实;备库长查询单次耗时过长扩大了时间窗口;热点大表的高频更新让特定数据块的UNDO版本尤其容易被覆盖。三者几乎同时作用,01555想不来都难。
4.3 组合拳式的解决方案
最终采用的方案是几个优化点组合起来,单独任何一个都不够彻底。
第一件事,扩容undo表空间并调整保留策略。把UNDO表空间从60G一次性扩到150G,保留AUTOEXTEND ON,MAXSIZE调到250G,undo_retention从7200秒调到14400秒。同时观察了几天,确认UNDO使用率峰值下降到40%上下,即使出现批量任务也没有逼近过80%的警戒线。
第二件事,为备库单独设置_minimum_giga_scn。考虑到系统当前的SCN在26万(十亿位)左右,设置了阈值260。这一招让备库的报表查询在SCN低于阈值后直接走当前读,等于给长查询加了一层“防快照过旧”的兜底。
第三件事,对备库上的大报表SQL进行改造。和业务团队确认了统计逻辑允许轻微数据延迟后,把原来按月拆分的统计进一步细化成按旬拆分的批处理。每次查询时长从接近50分钟压到8分钟左右。这一项改进其实是性价比最高的,因为它直接从源头减少了查询对UNDO历史的依赖窗口。
第四件事,在主库上对T_POLICY_DETAIL表的高频更新语句做了优化,增加了一个复合索引,减少了更新时的块访问量和UNDO记录量。这一步对主库的性能也有正向帮助,相当于是捎带的红利。
改造后的效果:连续观察了两周,备库的ORA-01555完全消失,报表任务的完成率从之前的86%提升到99%以上。更重要的是,即使后续遇到季度末业务高峰,系统的安全边际也明显足了很多,不再像以前那样战战兢兢。
这里有一点值得拿出来单独说:第四步中优化主库更新语句,间接产生了一个明显的正向效果——主库UNDO段上的回滚活动减少了,UNDO段中extent的复用频率变低,这相当于让备库端UNDO的“可用窗口”变得更稳定。所以排查ADG备库01555时,不要只盯着备库和UNDO参数,主库本身的事务方式也值得审视。
5. 常见问题排查与避坑指南
5.1 备库01555排查问题速查表
把这几年处理类似问题时积累的判断经验整理成表格,遇到问题可以直接按图索骥:
| 排查项 | 关键视角 | 常用SQL/命令 | 判断标准 |
|---|---|---|---|
| 主库UNDO空间余量 | 看使用率而非总量 | SELECT SUM(BYTES)/COUNT(*) FROM DBA_UNDO_EXTENTS... | 高峰使用率低于60-70% |
| 是否满足长查询窗口 | maxquerylen vs undo_retention | SELECT MAXQUERYLEN FROM V$UNDOSTAT | 保留期 > maxquerylen * 2 |
| redo apply是否有延迟 | 备库数据新鲜度 | SELECT NAME,VALUE FROM V$DATAGUARD_STATS | lag < 5秒 |
| MEDICAL cleanout触发的01555 | 报错消息是否含cleanout关键词 | alert log中搜索ORA-01555 | 判断事务槽重用问题 |
| 查询自身是否过长 | 单次查询耗时 | V$SQL/V$ACTIVE_SESSION_HISTORY | 单查询时间 > 30分钟需警惕 |
| 特定大表被高频更新 | 表空间/段的UNDO压力 | V$SEGMENT_STATISTICS | 确认热点对象是否关联查询目标表 |
5.2 一个最容易被忽略的坑:ORA-01555和延迟块清理并发
处理ADG备库01555时,有一种情况即使你UNDO配置得再大,也可能频繁报错,那就是延迟块清理与长查询并发导致的特殊场景。
如果你在告警日志里看到的ORA-01555错误关联的SQL是极短的查询(几秒就完成的那种),且错误消息中带有“failed to get consistent read for a block”等信息,那么问题可能根本不在UNDO保留,而在于块上有过多的事务槽需要回看。这种情况下,哪怕你再延长10倍UNDO保留时间,也只是把问题往后推迟几小时,而不是真正解决。
这种情况下,一个有效的土办法是:在备库上对热点表做一次在线重定义(DBMS_REDEFINITION),或者对表做一次全表UPDATE再回滚的“假更新”,强制清理掉那些延迟的事务信息。这个方法听上去有点暴力,但在目标表的数据量不是特别大时很管用。我曾在两张合计约6000万行的表上做过类似操作,效果立竿见影,之后近半年没有再出现同样的问题。
5.3 测试验证需要注意的细节
最后说说测试验证方法。无论你倾向于上面的哪种方案,落地之前都应该先在测试环境验证,尤其是涉及隐藏参数和强制保留策略的改动。我的一般做法是分下面几步:
第一步,在测试环境搭建一个和生产等比例缩小的ADG环境,主库上开一个压力测试脚本,通过DBMS_LOCK.SLEEP模拟出超长查询。具体做法是开启一个长事务暂不提交,再开一个会话执行查询,看UNDO覆盖时的行为。这一步能帮你在小范围内复现01555。
第二步,按需调整主库UNDO参数,观察v$undostat中的tuned_undoretention变化。这个值如果开始跟随你的设置调整并稳定下来,说明改动生效了。
第三步,在备库设置_minimum_giga_scn,对比设置前后的行为差异。
最后用10046事件来辅助验证(只在测试环境做,生产慎用)。
sql复制-- 在备库会话开启10046 trace
ALTER SESSION SET EVENTS '10046 trace name context forever, level 8';
-- 执行目标SQL
SELECT /*+ FULL(T) */ COUNT(*) FROM LARGE_TABLE T;
-- 关闭trace
ALTER SESSION SET EVENTS '10046 trace name context off';
查看生成的trace文件中是否有大量的“kdtgrsn”和“kcbgtcr”相关等待,可以判断查询过程中是否频繁尝试读取UNDO数据。如果在_minimum_giga_scn设置前后,trace中这些事件明显减少,说明参数生效了。
6. 最后的实战经验小结
这篇文章写到这里,核心内容已经完整了。回头看ADG备库上ORA-01555的整个问题链路,我个人觉得最重要的认知是:备库上的快照过旧和主库上的快照过旧,虽然报错相同,但底层逻辑的差异非常大。主库上的01555往往可以通过增加UNDO表空间、调整保留参数直接解决,备库上的01555却要把主库事务、UNDO保留、redo应用、备库查询时长四个层面的因素放到一起权衡。
如果你现在正被这个问题困扰,我建议按照优先级高低做这几件事:第一,先把主库的UNDO表空间余量给足,按峰值使用率的2到3倍规划;第二,检查备库上是否有执行时间超过30分钟的长查询,有的话优先做拆分或并行优化;第三,如果前两步不足以解决问题,再考虑开启_minimum_giga_scn,结合业务对数据一致性的容忍度来决定阈值设置;最后才是在极端情况下启用RETENTION GUARANTEE并配套严格的UNDO使用率监控。
再分享一个个人体会:在ADG读写分离这个架构下,备库查询的性能优化往往不只是SQL优化和索引优化那么简单,数据一致性机制带来的隐形约束,有时候比执行计划更致命。下次你的备库再报ORA-01555,可以先别急着调UNDO参数,回头看看主库的事务热点和你那个查询到底谁能熬过谁——Oracle的一致性读机制,本质上就是一场时间竞赛。把比赛节奏掌握在自己手里,01555自然就远离你的备库了。
