百度360必应搜狗淘宝本站头条
当前位置:网站首页 > 技术资源 > 正文

Oracle数据误操作全面恢复实战(r11笔记第78天)

lipiwang 2024-10-18 09:38 10 浏览 0 评论

对于DBA来说,面对误操作带来的数据恢复难度,其实很大。主要有以下几个方面:

  1. 误操作的影响范围极大,很可能不是删点,改点数据的操作,有时候可能是让人望而兴叹的truncate,drop操作。

  2. 数据恢复时需要确认数据损坏的时间点,依此来作为数据恢复的一个基准,该舍弃多少数据,该如何权衡,非常关键。

  3. 一旦信息提供错误,是否经得起反复折腾,我想这个对于绝大多数的数据恢复而言,基本都是一锤子买卖,能恢复已经不错了,还要反复恢复。但是一旦出现这种情况,可不能马上乱了阵脚。

灾备方案好不好,一试便知

自己也听了不少的数据灾难案例,其实备份终于一切这个没错,从逻辑层面还有几个地方需要注意,一个就是权限的入口需要控制,不给你犯错误的权限,能够大大减少犯错误的概率,这个之外的重点就是需要有实战演练,积累经验,做到临危不乱。

怎么实战呢,我有一次和同事说,数据恢复,备份策略的规划等,很多具体的场景可能有所不同,但是一主两备的核心业务,我小保证数据能够在一定范围内随时恢复,怎么验证备份恢复策略的有效性呢,我也不看你的方案和计划,我就在一个不定的时间点删点数据,truncate操作一下,然后隔一段时间之后告诉你恢复,能恢复回来那就能证明这个方案是可行的。

灾备方案不容忽视

注意我这里所说的就是一主两备的方案,对于核心业务还是建议这样的方式,备库1和主库在同机房或者同城机房,备库2在异地机房或者同城不同位置的机房,这样能够大大降低出现意外灾害带来的数据灾难。

防完天灾,看看人祸,人为误操作或者应用错误带来的影响其实影响力要大得多,所以这种情况下,我的一般建议都是在备库2开启闪回数据库,然后保留一定的窗口时间延迟。

开启延迟有下面三种方法,重点推荐方法3,使用DG Broker的方式。

方法1

alter database recover managed standby database delay 120 disconnect from session;方法2

alter system set log_archive_dest_3='service=db3 lgwr async delay=120valid_for=(all_logfiles,all_roles) db_unique_name=db3';
方法3:

DG Broker中设置延迟

edit database xxxx set property DelayMins=180;

没有环境,我们“破坏”环境

当然我们就干脆一些,直接破坏下环境(自己创建数据自己破坏),也总结下经验。

我们在主库端创建数据,然后使用truncate删除,当然这个过程我也不会刻意去记录时间。

create table test_recover(id number,name varchar2(30));
insert into test_recover select level,'obj'||level from dual connect by level<=10;
commit;
truncate table test_recover;
就这么几个步骤就可以完整模拟一个破坏场景,来吧,恢复吧。

而且我也不知道具体的时间,大概就是在晚上九点多快10点操作的。

数据恢复基本步骤

这个时候我们先从备库入手。

DGMGRL> show configuration;
Configuration - dg_accdb1
Protection Mode: MaxPerformance
Databases:
accdb1 - Primary database
saccdb1 - Physical standby database
s2accdb1 - Physical standby database
Fast-Start Failover: DISABLED
Configuration Status:
SUCCESS
因为备库2开启延迟应用,所以我们先取消延迟,使得数据先同步,如果是已有的表drop等操作,延迟应用的优势就出来了。

DGMGRL> edit database s2accdb1 set property DelayMins=0;
Property "delaymins" updated
这个备库还是ADG模式

SQL> select open_mode from v$database;
OPEN_MODE
--------------------
READ ONLY WITH APPLY
我们关闭日志应用。

SQL> recover managed standby database cancel;
Media recovery complete.
准备闪回,先把备库置为mount状态

SQL> alter database close;
Database altered.

这个时候问题就来了,我们要闪回到哪个时间点去?

SQL>flashback database to timestamp to_timestamp('xxxxx','yyyy-mm-dd hh24:mi:ss');这个时间点怎么得到呢,一种就是确认,如果确认不了也可以根据应用日志等信息来辅证,当然严谨的方法是我们通过很精确的方式得到,那就是解析日志。


使用LogMiner解析日志

在主库端通过LogMiner解析日志,我写了两个脚本方便调用。

$ cat check_log.sh
sqlplus -s / as sysdba <<EOF
set linesize 150
col member format a50
select l.sequence#,l.status ,l.bytes/1024/1024 size_MB,f.member from v\$log l ,v\$logfile f where l.group#=f.group#;
EOF
我们通过脚本调用可以看到日志的基本信息,如果是最近的,就可以优先调用看看是否满足。

$ sh check_log.sh
SEQUENCE# STATUS SIZE_MB MEMBER
---------- ----------------- --------------------------------------------------
237 CURRENT 500 /U01/app/oracle/oradata/accdb1/redo03.log
236 INACTIVE 500 /U01/app/oracle/oradata/accdb1/redo02.log
235 INACTIVE 500 /U01/app/oracle/oradata/accdb1/redo01.log
第二个脚本是使用LogMiner解析日志。

$ cat showlog.sh
sqlplus -s / as sysdba <<EOF
execute dbms_logmnr.add_logfile(logfilename=>'$1',options=>dbms_logmnr.new);
execute dbms_logmnr.start_logmnr(options=>dbms_logmnr.dict_from_online_catalog);
alter session set nls_date_format='yyyy-mm-dd hh24:mi:ss';
col xid_scn format a30
col username format a10
col timestamp format a20
col sql_redo format a35
col sql_undo format a35
set pages 1500
set linesize 200
select username,xid||':'||scn xid_scn,timestamp,sql_redo,sql_undo from v\$logmnr_contents where sql_redo not like '%AUD$%';
execute dbms_logmnr.end_logmnr;
EOF

调用脚本的结果如下,就这样我会得到一个基本详细的日志解析内容。

$ sh showlog.sh /U01/app/oracle/oradata/accdb1/redo02.log > /tmp/b.log

几乎没有花什么功夫就搜索到了下面的信息,truncate的一个时间点。

UNKNOWN 0A000D00C44E0100:233170277520 2017-02-17 21:58:06 truncate table test_recover;我们根据这个时间点来进行恢复。
在备库端开启闪回数据库,闪回到那个时间点附近,比如提前1秒。

SQL> flashback database to timestamp to_timestamp('2017-02-17 21:58:05','yyyy-mm-dd hh24:mi:ss');过个把分钟就可以轻松搞定,闪回得越早,恢复的时间越长。

如果时间点不满足,可以反复闪回,直到满意为止。

然后我们打开数据库。

SQL> alter database open read only;
Database altered.
查看数据的情况就是最开始期望的了。

SQL> select *from cydba.test_recover;
ID NAME
---------- ------------------------------
1 obj1
2 obj2
3 obj3
4 obj4
5 obj5
6 obj6
7 obj7
8 obj8
9 obj9
10 obj10


恢复后的收尾工作

数据恢复之后,皆大欢喜,我们就可做一些收尾工作,继续开启日志应用。

SQL> alter database close;
Database altered.
SQL> alter database open;
Database altered.

这个时候日志应用是关闭了,因为之前使用了recover managed standby database cancel的命令。

DGMGRL> show configuration;
Configuration - dg_accdb1
Protection Mode: MaxPerformance
Databases:
accdb1 - Primary database
saccdb1 - Physical standby database
s2accdb1 - Physical standby database
Error: ORA-16766: Redo Apply is stopped
Fast-Start Failover: DISABLED
Configuration Status:
ERROR
继续开启日志应用。

DGMGRL> enable database s2accdb1;
Enabled.
DGMGRL> show configuration;
Configuration - dg_accdb1
Protection Mode: MaxPerformance
Databases:
accdb1 - Primary database
saccdb1 - Physical standby database
s2accdb1 - Physical standby database
Fast-Start Failover: DISABLED
Configuration Status:
SUCCESS
就这样数据库的恢复就告一段落。

有几个细小的问题需要格外注意,一个是主备的时间需要确保同步,如果不同步,闪回就会有潜在问题。

相关推荐

想减少Windows 11内存占用?请取消固定Teams

如果你想要提高Windows11系统的运行速度,那么可以禁用某些默认启用的功能和设置。如果你的Windows11是安装在已经停止支持的设备或者内存容量不高的旧设备,那么应该立即限制或禁用固...

Windows查看端口占用、查看PID对应的进程、并终止进程

Windows下:查看端口占用netstat-ano|findstr"端口号"获取到pid查看PID对应的进程tasklist|findstr"进程ID"...

计算机组成原理(36): 分时之一——进程

建立一个虚拟机VM目标:给每个程序一个自己的虚拟机“VirtualMachine”,程序并不知道其他的虚拟机。1.1进程(Process)为了捕获正在运行的程序,我们创建一个称为“进程(Proce...

window系统如何停止端口被占用的进程(高手版)

如上图1,作为开发人员是不是经常遇到这个问题?(Webserverfailedtostart.Port9527wasalreadyinuse.)当然,如果在你知道确实有某个进程正占...

电脑的文件无法删除咋回事?你需要这款神兵利器

很多朋友用电脑的时候,都遇到过文件无法删除的情况。这往往是由于文件被某个软件、进程所调用所引发的——在Windows中,某个文件如果被使用,这个文件可能就没法进行删除、重命名之类的操作了。想要进一步操...

Windows日志分析(windows 日志文件)

1.Windows日志文件简介1.1Windows日志核心分类1.系统日志系统日志包含由Windows系统组件记录的事件,记录系统进程和设备驱动程序的活动。由它审核的系统事件包括启动失败的设备驱动程...

电脑软件崩溃、闪退不用慌!DJS Tech 教你几招轻松解决

当你正全神贯注用电脑处理重要文件、沉浸在精彩的游戏世界,或是观看喜欢的视频时,软件突然崩溃、闪退,那一刻的烦躁简直难以言喻。别着急,DJSTech作为深耕计算机领域多年的专业团队,为你带来一系列超...

微软Win11推进淘汰控制面板,时间服务器配置迁移至设置应用

IT之家5月29日消息,科技媒体Winaero昨日(5月28日)发布博文,报道称微软在Windows11系统中,继续推进“淘汰控制面板”进程,配置时间服务器地址选项迁移到设置应...

微软 PowerToys更新,可帮你找出 Win11上哪些进程正在占用该文件

IT之家11月3日消息,微软针对Windows11和Windows10的PowerToys已经更新到了最新的0.64.0版本,并上线了一个名为“文件锁匠FileLock...

Windows基础操作 认识任务管理器(windows任务管理器的使用)

Windows基础操作:认识任务管理器任务管理器(TaskManager)是Windows系统中一个功能强大的实用工具,它为用户提供了实时监控系统资源、管理正在运行的程序和服务的能力。掌握任务管理器...

windows——netstat过滤(终止进程)

windows——netstat过滤(终止进程)在Windows操作系统中,使用netstat命令可以查看网络连接的状态。要过滤特定协议或端口的连接,可以使用以下命令:查看所有连接:netstat-...

只要这么做 Windows Defender与第三方就能和平共存啦

无论大家是否喜欢WindowsDefender,伴随着Windows10的不断升级,它已经成为系统的底层必备组件之一。虽然我们有各种各样的方法去关闭它,换用顺手的第三方,但只要更新打补丁,噩梦就来...

Win10如何彻底关闭wsappx进程(win10 wsappx怎么关闭)

win10如何彻底关闭wsappx进程?wsappx进程是什么?wsappx进程是Windows10系统的一部分,这个进程是WindowsStore和微软通用应用程序平台(UWP)的依赖进程。...

Windows环境黑客入侵应急与排查(黑客入侵电脑原理)

1文件分析1.1临时目录排查黑客往往可能将病毒放在临时目录(tmp/temp),或者将病毒相关文件释放到临时目录,因此需要检查临时目录是否存在异常文件。假设系统盘在C盘,则通常情况下的临时目录如下...

Windows 11 24H2 KB5044384出现大面积安装失败、任务管理器0进程等问题

Windows11KB5044384更新由于出现大量错误而无法在Windows1124H2上安装、其中包括一个奇怪的错误,即由于0x800f0922、0x800736b3和0x8...

取消回复欢迎 发表评论: