首页  ·  知识 ·  数据库
Oracle删重复记录
佚名  http://tolywang.itpub.net/post/48/455802    编辑:dezai  图片来源:网络
1、通过创建临时表可以把数据先导入到一个临时表中,然后删除原表的数据,再把数据导回原表,SQL语句如下: creat table tb

1、通过创建临时表
可以把数据先导入到一个临时表中,然后删除原表的数据,再把数据导回原表,SQL语句如下:

 


creat table tbl_tmp (select distinct* from tbl);truncate table tbl;
//清空表记录insert into tbl select * from tbl_tmp;//将临时表中的数据插回来。

这种方法可以实现需求,但是很明显,对于一个千万级记录的表,这种方法很慢,在生产系统中,这会给系统带来很大的开销,不可行。

2、利用rowid

在oracle中,每一条记录都有一个rowid,rowid在整个数据库中是唯一的,rowid确定了每条记录是oracle中的哪一个数据文件、块、行上。在重复的记录中,可能所有列的内容都相同,但rowid不会相同。SQL语句如下:

delete from tbl where rowid in (select a.rowid from tbl a,
 tbl b where a.rowid>b.rowid and a.col1=b.col1 and a.col2 = b.col2) 

如果已经知道每条记录只有一条重复的,这个sql语句适用。但是如果每条记录的重复记录有N条,这个N是未知的,就要考虑适用下面这种方法了。

3、利用max或min函数

这里也要使用rowid,与上面不同的是结合max或min函数来实现。SQL语句如下

delete from tbl awhere rowid not in (select max(b.rowid)
 from tbl b where a.col1=b.col1 and a.col2 = b.col2);
//这里max使用min也可以 

或者用下面的语句

delete from tbl awhere rowid<(select max(b.rowid)
 from tbl b where a.col1=b.col1 and a.col2 = b.col2);
//这里如果把max换成min的话,前面的where子句中需要把"<"改为">" 

跟上面的方法思路基本是一样的,不过使用了group by,减少了显性的比较条件,提高效率。SQL语句如下:

deletefrom tbl where rowid not in (select max(rowid)
 from tbl tgroup by t.col1, t.col2);delete from tbl where (col1, col2)
in (select col1,col2 from tblgroup bycol1,col2havingcount(*)
>1)and rowidnotin(selectnin(rowid)fromtblgroup bycol1,
col2havingcount(*) >1) 

还有一种方法,对于表中有重复记录的记录比较少的,并且有索引的情况,比较适用。假定col1,col2上有索引,并且tbl表中有重复记录的记录比较少,SQL语句如下4、利用group by,提高效率

4、Group By方法(经常用的一种方法)
一、查数据
Select count(Num) ,max(Name) from student --列出重复记录,并列出属性
Group By Name
Having count(Num) >1 --按Name分组后找出表中Num列重复,即出现次数大于1

二、删数据
Delete from student Group By Name Having count(Num) > 1

tolywang 发表于:2007.12.27 15:21 ::分类: ( Oracle数据库管理 ) ::阅读:(58次) :: 评论 (2) :: 引用 (0)  re: Oracle删重复记录 [回复]
平时工作中可能会遇到当试图对库表中的某一列或几列创建唯一索引时,系统提示 ORA-01452 :不能创建唯一索引,发现重复记录。
  下面总结一下几种查找和删除重复记录的方法(以表CZ为例):
表CZ的结构如下:
SQL> desc cz
Name Null? Type

  C1 NUMBER(10)
C10 NUMBER(5)
C20 VARCHAR2(3)

  删除重复记录的方法原理:
(1).在Oracle中,每一条记录都有一个rowid,rowid在整个数据库中是唯一的,rowid确定了每条记录是在Oracle中的哪一个数据文件、块、行上。

  (2).在重复的记录中,可能所有列的内容都相同,但rowid不会相同,所以只要确定出重复记录中那些具有最大rowid的就可以了,其余全部删除。

  重复记录判断的标准是:
C1,C10和C20这三列的值都相同才算是重复记录。

  经查看表CZ总共有16条记录:
SQL>set pagesize 100
SQL>select * from cz;

  C1 C10 C20

  1 2 dsf
1 2 dsf
1 2 dsf
1 2 dsf
2 3 che
1 2 dsf
1 2 dsf
1 2 dsf
1 2 dsf
2 3 che
2 3 che
2 3 che
2 3 che
3 4 dff
3 4 dff
3 4 dff
4 5 err
5 3 dar
6 1 wee
7 2 zxc

  20 rows selected.

  1.查找重复记录的几种方法:
(1).SQL>select * from cz group by c1,c10,c20 having count(*) >1;
C1 C10 C20

  1 2 dsf
2 3 che
3 4 dff

  (2).SQL>select distinct * from cz;

  C1 C10 C20

  1 2 dsf
2 3 che
3 4 dff

  (3).SQL>select * from cz a where rowid=(select max(rowid) from cz where c1=a.c1 and c10=a.c10 and c20=a.c20);
C1 C10 C20

  1 2 dsf
2 3 che
3 4 dff

  2.删除重复记录的几种方法:
(1).适用于有大量重复记录的情况(在C1,C10和C20列上建有索引的时候,用以下语句效率会很高):
SQL>delete cz where (c1,c10,c20) in (select c1,c10,c20 from cz group by c1,c10,c20 having count(*)>1) and rowid not in
(select min(rowid) from cz group by c1,c10,c20 having count(*)>1);

  SQL>delete cz where rowid not in(select min(rowid) from cz group by c1,c10,c20);

  (2).适用于有少量重复记录的情况(注意,对于有大量重复记录的情况,用以下语句效率会很低):
SQL>delete from cz a where a.rowid!=(select max(rowid) from cz b where a.c1=b.c1 and a.c10=b.c10 and a.c20=b.c20);

  SQL>delete from cz a where a.rowiddelete from cz a where rowid create table test as select distinct * from cz; (建一个临时表test用来存放重复的记录)

  SQL>truncate table cz; (清空cz表的数据,但保留cz表的结构)

  SQL>insert into cz select * from test; (再将临时表test里的内容反插回来)

  (4).适用于有大量重复记录的情况(Exception into 子句法):
采用alter table 命令中的 Exception into 子句也可以确定出库表中重复的记录。这种方法稍微麻烦一些,为了使用“excepeion into ”子句,必须首先创建 EXCEPTIONS 表。创建该表的 SQL 脚本文件为 utlexcpt.sql 。对于win2000系统和 UNIX 系统, Oracle 存放该文件的位置稍有不同,在win2000系统下,该脚本文件存放在$ORACLE_HOMEOra90rdbmsadmin 目录下;而对于 UNIX 系统,该脚本文件存放在$ORACLE_HOME/rdbms/admin 目录下。

  具体步骤如下:
SQL>@?/rdbms/admin/utlexcpt.sql

  Table created.

  SQL>desc exceptions
Name Null? Type

  ROW_ID ROWID
OWNER VARCHAR2(30)
TABLE_NAME VARCHAR2(30)
CONSTRAINT VARCHAR2(30)

  SQL>alter table cz add constraint cz_unique unique(c1,c10,c20) exceptions into exceptions;
*
ERROR at line 1:
ORA-02299: cannot validate (TEST.CZ_UNIQUE) - duplicate keys found

  SQL>create table dups as select * from cz where rowid in (select row_id from exceptions);

  Table created.

  SQL>select * from dups;

  C1 C10 C20

  1 2 dsf
1 2 dsf
1 2 dsf
1 2 dsf
2 3 che
1 2 dsf
1 2 dsf
1 2 dsf
1 2 dsf
2 3 che
2 3 che
2 3 che
2 3 che
3 4 dff
3 4 dff
3 4 dff

  16 rows selected.

  SQL>select row_id from exceptions;

  ROW_ID

AAAHD/AAIAAAADSAAA
AAAHD/AAIAAAADSAAB
AAAHD/AAIAAAADSAAC
AAAHD/AAIAAAADSAAF
AAAHD/AAIAAAADSAAH
AAAHD/AAIAAAADSAAI
AAAHD/AAIAAAADSAAG
AAAHD/AAIAAAADSAAD
AAAHD/AAIAAAADSAAE
AAAHD/AAIAAAADSAAJ
AAAHD/AAIAAAADSAAK
AAAHD/AAIAAAADSAAL
AAAHD/AAIAAAADSAAM
AAAHD/AAIAAAADSAAN
AAAHD/AAIAAAADSAAO
AAAHD/AAIAAAADSAAP

  16 rows selected.

  SQL>delete from cz where rowid in ( select row_id from exceptions);

  16 rows deleted.

  SQL>insert into cz select distinct * from dups;

  3 rows created.

  SQL>select *from cz;

  C1 C10 C20

  1 2 dsf
2 3 che
3 4 dff
4 5 err
5 3 dar
6 1 wee
7 2 zxc

  7 rows selected.

  从结果里可以看到重复记录已经删除。

tolywang 评论于:2007.12.27 15:24  re: Oracle删重复记录 [回复]
删除重复记录的几种方法:

(1).适用于有大量重复记录的情况(在C1,C10和C20列上建有索引的时候,用以下语句效率会很高):
SQL>delete cz where (c1,c10,c20) in (select c1,c10,c20 from cz group by c1,c10,c20 having count(*)>1) and rowid not in
(select min(rowid) from cz group by c1,c10,c20 having count(*)>1);

  SQL>delete cz where rowid not in(select min(rowid) from cz group by c1,c10,c20);

(2).适用于有少量重复记录的情况(注意,对于有大量重复记录的情况,用以下语句效率会很低):
SQL>delete from cz a where a.rowid!=(select max(rowid) from cz b where a.c1=b.c1 and a.c10=b.c10 and a.c20=b.c20);

  SQL>delete from cz a where a.rowiddelete from cz a where rowid create table test as select distinct * from cz; (建一个临时表test用来存放重复的记录)

  SQL>truncate table cz; (清空cz表的数据,但保留cz表的结构)

  SQL>insert into cz select * from test; (再将临时表test里的内容反插回来)

 

本文作者:佚名 来源:http://tolywang.itpub.net/post/48/455802
CIO之家 www.ciozj.com 微信公众号:imciow
   
免责声明:本站转载此文章旨在分享信息,不代表对其内容的完全认同。文章来源已尽可能注明,若涉及版权问题,请及时与我们联系,我们将积极配合处理。同时,我们无法对文章内容的真实性、准确性及完整性进行完全保证,对于因文章内容而产生的任何后果,本账号不承担法律责任。转载仅出于传播目的,读者应自行对内容进行核实与判断。请谨慎参考文章信息,一切责任由读者自行承担。
延伸阅读