如何对数据为什么进行数据预处理预处理,将较大数量级的差别调整到一个合适的范围

如何在很大数量级的数据中(比如1个亿)筛选出前10万个最大值?
阅读权限20
在线时间 小时
香川群子 发表于
这一句可以注释掉。……目的是把数组结果输出到A1开始的A列。
谢。注释后,跑出:
去掉出错句.png (11.96 KB, 下载次数: 43)
15:28 上传
速度如此快。得细细究。
阅读权限20
在线时间 小时
本帖最后由 汇铁 于
16:40 编辑
为了看出各位程序的正确性。做以下工作:
1、增加了将数组数据写文件的代码。
2、增加读文件的代码。这样,各自程序,是对相同数据作处理。
3、增加将得到的有效数据写各自独立的结果文件的代码。
这样,可对最后得到的文件进行比较。
1、香川群子 结果文件400000字节。
2、Zamyi& && &结果文件400004字节。这个,多了四字节。
3、汇铁& && &&&结果文件400000字节。
4、三者结果文件,两两之间,用 BCompare 程序作比较。各不相同。即,至少有两个人是错的。也可能三人都错。
还可能,我增加的读写文件本身有错。(对VB的不熟悉,增加了这个错误的可能性)。各位,可看代码判断。
代码如下:
'相关于香川群子的代码:
Function LargeSmallTest(inFile, outFile, m, n) As Double
& & Dim ar&(), br&(), i&, k&, L&, u&, v, z&, tms#
& & ReDim ar&(1 To m)& && && &'定义存放原始数据数组ar 因内存限制定义为整型
& & Get #inFile, 1, ar& && &&&'=============&&增加的读文件
& & tms = Timer
& & '下面是正式代码过程:
& & L = LBound(ar): u = UBound(ar)
& & z = 1 'z=1时 提取前n个最大值 / z=0时 提取前n个最小值
& & If z Then k = u - L - n + 2 Else k = L + n - 1 '转换得到实际分界位置k
& & v = QuickSort2(ar, L, u, k) '调用QuickSort2快排过程 提取第n个的分界值
& & '下面是把已经整理好的前n个值全部提取出来存入数组br
& & ReDim br&(n - 1)& && && & '定义存放n个最大/最小值结果的数组br
& & If z Then& && && && && &&&'z=1需要最大值时 从最后位置开始提取
& && &&&For i = 0 To n - 1
& && && && &br(i) = ar(m - i)
& && &&&Next
& & Else& && && && && && && & 'z=0需要最小值时 从最初位置开始提取
& && &&&For i = 0 To n - 1
& && && && &br(i) = ar(i + L)
& && &&&Next
& & End If
& & '注意这样提取到的n个最大/最小结果 并没有排序(题目没要求)
& & 'MsgBox Format(Timer - tms, &0.00s&)
& & LargeSmallTest = Timer - tms
& & Put #outFile, 1, br& && & '=============&&增加的写文件
End Function
Function QuickSort2(tr, L&, u&, k&) '递归算法的快速排序过程 不解释
& & Dim i&, j&, R, t
& & i = L: j = u: R = tr((L + u) \ 2)
& & While i & j
& && &&&Do While i & u
& && && && &If tr(i) & R Then i = i + 1 Else Exit Do
& && &&&Loop
& && &&&Do While j & L
& && && && &If tr(j) & R Then j = j - 1 Else Exit Do
& && &&&Loop
& && &&&If i & j Then t = tr(i): tr(i) = tr(j): tr(j) = t: i = i + 1: j = j - 1 Else If i = j Then i = i + 1: j = j - 1
& & If k & j + 1 Then If j & L Then Call QuickSort2(tr, L, j, k)
& & If k & i - 1 Then If i & u Then Call QuickSort2(tr, i, u, k)
& & QuickSort2 = tr(k) '记录返回本次计算得到的第n个分界值
End Function
'===============================================================
'相关于 Zamyi 的代码;
Function test(inFile, outFile, n, m) As Double
&&Dim a&(), i&, j&, k&, b&()
&&ReDim a&(1 To n)
&&Get #inFile, 1, a& && && &&&'=============&&增加的读文件
&&t = Timer
&&k = n * (1 - 2 * m / n)
&&For i = 1 To n
& & If a(i) & k Then j = j + 1
&&If j & m Then
& & k = k * j / m
& & GoTo 100
&&If j / m & 10 Then
& & k = k / m * j
& & GoTo 100
&&For i = 1 To n
& & If a(i) & k Then a(j) = a(i): j = j + 1
&&F_QSort a, 1, j - 1
&&'ReDim Preserve a(1 To m)
&&'MsgBox Timer - t
&&ReDim b&(m - 1)& && && && && &&&'(1 To m, 0)
&&For i = 1 To m
& & b(i) = a(i)
&&test = Timer - t
&&Put #outFile, 1, b& && && & '=============&&增加的写文件
End Function
Sub F_QSort(key_arr&(), L As Long, R As Long)
Dim i As Long, j As Long, a As Long, b As Long, Mid As Long, offset As Long
Dim Pivot&, Swap&
nZ = nZ + 1
If R - L &= 60 Then
&&For offset = 0 To 18
& & For i = L + offset To R Step 19
& && &Swap = key_arr(i)
& && &For j = i - 19 To L + offset Step -19
& && &&&If Swap & key_arr(j) Then
& && && & key_arr(j + 19) = key_arr(j)
& && && & key_arr(j) = Swap
& && &&&Else
& && && & Exit For
& && &&&End If
& && &Next j
& & Next i
&&Next offset
&&For offset = 0 To 4
& & For i = L + offset To R Step 5
& && &Swap = key_arr(i)
& && &For j = i - 5 To L + offset Step -5
& && &&&If Swap & key_arr(j) Then
& && && & key_arr(j + 5) = key_arr(j)
& && && & key_arr(j) = Swap
& && &&&Else
& && && & Exit For
& && &&&End If
& && &Next j
& & Next i
&&Next offset
&&For i = L + 1 To R
& & Swap = key_arr(i)
& & For j = i - 1 To L Step -1
& && &If Swap & key_arr(j) Then
& && &&&key_arr(j + 1) = key_arr(j)
& && &&&key_arr(j) = Swap
& && &Else
& && &&&Exit For
& && &End If
& & Next j
'&&Mid = L + 1 + Int(Rnd * (R - L - 1))
& & Mid = (L + R) / 2
&&If key_arr(L) & key_arr(R) Then
& & Swap = key_arr(R)
& & key_arr(R) = key_arr(L)
& & key_arr(L) = Swap
&&If key_arr(Mid) & key_arr(R) Then
& & Swap = key_arr(R)
& & key_arr(R) = key_arr(Mid)
& & key_arr(Mid) = Swap
&&If key_arr(L) & key_arr(Mid) Then
& & Swap = key_arr(L)
& & key_arr(L) = key_arr(Mid)
& & key_arr(Mid) = Swap
&&Pivot = key_arr(Mid)
&&key_arr(Mid) = key_arr(R - 1)
&&key_arr(R - 1) = Pivot
&&i = L + 1
&&j = R - 2
&&While (i & j)
& & For i = i To R
& && &If key_arr(i) &= Pivot Then Exit For
& & Next i
& & For j = j To L Step -1
& && &If key_arr(j) &= Pivot Then Exit For
& & Next j
& & If (i & j) Then
& && &Swap = key_arr(i)
& && &key_arr(i) = key_arr(j)
& && &key_arr(j) = Swap
& && &i = i + 1
& && &j = j - 1
& & End If
&&For a = j To L Step -1
& & If key_arr(a) & Pivot Then Exit For
&&For b = i To R
& & If key_arr(b) & Pivot Then Exit For
&&If (L & a) Then Call F_QSort(key_arr, L, a)
&&If (b & R) Then Call F_QSort(key_arr, b, R)
'===============================================================
Sub writeAllData(inFile, m, n)
&&Dim ary&()
&&ReDim ary(1 To m)
&&For i = 1 To m
& & ary(i) = Rnd * m + 1
&&Put #inFile, 1, ary
Sub control(m, n)
&&inFile = FreeFile
&&Open &D:\inFile.dat& For Binary Access Read Write As #inFile
&&Call writeAllData(inFile, m, n) '增加的写文件,非VB写的程序可用同样数据
&&outFile1 = FreeFile
&&Open &D:\outFile_xcqz.dat& For Binary Access Read Write As #outFile1
&&t1 = LargeSmallTest(inFile, outFile1, m, n)
&&outFile2 = FreeFile
&&Open &D:\outFile_Zamyi.dat& For Binary Access Read Write As #outFile2
&&t2 = test(inFile, outFile2, m, n)
&&Close #outFile1
&&Close #outFile2
&&Close #inFile
&&MsgBox Format(t1, &0.00s&)
&&MsgBox Format(t2, &0.00s&)
'===============================================================
Private Sub Form_Load()
&&n = 10 ^ 5& && && && &&&'需要提取的最大/最小值个数n
&&m = n * 10 ^ 3& && && & '按比例计算原始数据总数m
&&Call control(m, n)
相关于我的代码:
void __fastcall TForm1::Top(int m, int n, bool minTop)
&&int* ar= new int[m], *br= new int[n+ 2], count= 0;
&&int inFileNumber= open(&D:\\inFile.dat&, 2);
&&lseek(inFileNumber, 0, SEEK_SET);
&&_rtl_read(inFileNumber, ar, 4* m);
&&close(inFileNumber);
&&double tms= GetTickCount();
&&for(int i= 0; i& i++)
& & MakeTop(br, n, & count, ar, minTop);
&&ShowMessage(String(GetTickCount()- tms)+ &毫秒&);& && && && &
&&int outFileNumber= _rtl_creat(&D:\\outFile_ht.dat&, 2);
&&lseek(outFileNumber, 0, SEEK_SET);
&&_rtl_write(outFileNumber, br, 4* n);
&&close(outFileNumber);
&&delete []
&&delete []
另,我的代码少贴了一部分。少的部分,23楼有。
阅读权限95
在线时间 小时
汇铁 发表于
为了看出各位程序的正确性。做以下工作:
1、增加了将数组数据写文件的代码。
2、增加读文件的代码。这样 ...
你可以生成Long类型自然数序列,然后随机乱序存为原始数据。
这以后,随便定一个取值数k,比较3个程序的提取结果中第k个值是否相同,即可判断程序是否有错误。
其它原始数据中存在相同重复数的情况下,
那么比较第k个值以及总和即可。
阅读权限20
在线时间 小时
本帖最后由 汇铁 于
10:27 编辑
汇铁 发表于
为了看出各位程序的正确性。做以下工作:
1、增加了将数组数据写文件的代码。
2、增加读文件的代码。这样 ...
这里的结论,下得早了点。因为,香川群子与Zamyi的结果数据,可能没排序。直接比较,不妥。下面的代码,先读入两位的结果文件,再用C++语言的 sort 函数排序。再比较,就不会出现上述问题了。但是,很遗憾,她和他的代码,都没得到正确结果。
&&int n= 100000, m= n* pow(10, 3);& && && && && && && && && && &//m= 10^ 3 */
&&int* inArray= new int[m];
&&int inFileNumber= open(&D:\\inFile.dat&, 0);
&&_rtl_read(inFileNumber, inArray, m* 4);
&&sort(inArray, inArray+ m);& && && && && && && && && && && && &//原始数据排序
&&int *Array0= new int[n+ 1];
&&int FileNumber0= open(&D:\\outFile_xcqz.dat&, 0);
&&_rtl_read(FileNumber0, Array0, 4* n);
&&sort(Array0, Array0+ n);& && && && && && && && && && && && &&&
&&for(int i= 0; i&= i++)
& & if(i== n || inArray{i}!= Array0{i})
& && &ShowMessage(String(&香川群子程序&)+ (i== n? &对&:&错&)), i=
&&int*Array1= new int[n+ 2];
&&int FileNumber1= open(&D:\\outFile_Zamyi.dat&, 0);
&&_rtl_read(FileNumber1, Array1, 4* n+ 4);
&&sort(Array1, Array1+ n+ 1);
&&for(int i= 0; i&= i++)
& & if(i== n || inArray{i}!= Array1{i})
& && &ShowMessage(String(&Zamyi程序&)+ (i== n? &对&:&错&)), i=
&&close(FileNumber0);
&&close(FileNumber1);
&&close(inFileNumber);
上面代码中,有两处用了花括号。它本应该是方括号。不知为何。发贴后,自动去掉了方括号。故用花括号代表。
阅读权限20
在线时间 小时
本帖最后由 汇铁 于
21:17 编辑
正确代码来了。用了C++库中的排序,与排序了的取值结果比较。
void sort1(int Data[], int m, int n, int Out[])
{
&&for(int count= 0, i= 0; i& i++)
& & if(count== n && Data&= Out[n-1])
& && && && && && && && && && && && && && && && && && & //无效数据
& & else
& && &for(int j= 0; ; j++)& && && && && && && && && && && && &&&//顺序查找
& && &&&if(j== count || Data&= Out[j])& && && && && && && &&&//找到插入点
& && &&&{
& && && & for(int k= k& k--)& && && && && && && && &&&//空出插入点
& && && && &Out[k]= Out[k- 1];
& && && & Out[j]= D
& && && & if(count& n)
& && && && &count++;& && && && && && && && && && && && && && &&&//增加队列长
& && && &
& && &&&}
}
void ShowTime(String caption, Double &tms)
{
&&ShowMessage(String(caption+ && &&+ (GetTickCount()- tms)/1000)+ &秒&);
&&tms= GetTickCount();
}
void control(int n)
{
&&int m= n* pow(10, 3);
&&double tms= GetTickCount();
&&int *Data= new int[m], *DataSort= new int[m];
&&int *Out=&&new int[n+ 1];
&&for(int i= 0; i& i++)& && && && && && && && && && && && &&&//得随机数
& & DataSort= Data= random(m);
&&ShowTime(&制造随机数用时&, tms);
&&sort(DataSort, DataSort+ m);
&&ShowTime(&标准排序用时&, tms);
&&sort1(Data, m, n, Out);
&&ShowTime(&排序用时&, tms);
&&for(int lim= n, i= 0; i&= i++)
& & if(i== lim || DataSort!= Out)
& && &ShowMessage(i== lim? &取值正确&:&取值出错&), i=
&&delete []DataS
&&delete []D
&&delete []O
}复制代码下一步,准备写出折半查找、链排序、堆排序等。有兴趣的你,请回复一下。保证代码正确哟。
一亿取十万,用时:
制造随机数据:8.346秒。
标准排序:75.864秒。
本代码:秒。
阅读权限20
在线时间 小时
本帖最后由 汇铁 于
22:15 编辑
汇铁 发表于
正确代码来了。用了C++库中的排序,与排序了的取值结果比较。
下一步,准备写出折半查找、链排序、堆排序等 ...
折半查找的代码:
void sort2(int Data[], int m, int n, int Out[])
{
&&for(int count= 0, i= 0; i& i++)
& & if(count== n && Data[i]&= Out[n- 1])
& && &
& & else
& & {
& && &int mid, low= 0, high= count- 1;
& && &for( ; mid=(high+ low)&& 1, low&= )& && && && && &&&//折半查找
& && &&&if(Data[i]&= Out[mid]) low= mid+ 1; else high= mid- 1;
& && &for(int k= k& k--)& && && && && && && && && & //空出插入点
& && &&&Out[k]= Out[k- 1];
& && &Out[low]= Data[i];
& && &if(count& n)
& && &&&count++;
&&}
}复制代码 折半查找,用时:标准:53.8秒;取值:278.508秒。从标准排序看,似乎,这次,程序跑得更快。也就是说,机器的速度,并不是固定的。
阅读权限100
在线时间 小时
本帖最后由 liucqa 于
15:20 编辑
我觉得大家没必要在论坛讨论此类百度一搜一大堆的东东。这个论坛其实处理不了如此专业且复杂的技术问题。
特殊设定的不同分界值把整个数据区域分解成尽可能多的小单元,每个数据通过与不同分界值的对比迅速归位于相应的单元内, 然后对各单元内的数据进行排序,按序连接各单元,最终达到排序的目的
bit位操作 思考下面的问题: 一个最大的9位整数为 这9亿条数据是不重复的,可不可以把这些数据组成一个队列或数组,让它有0~亿个)元素数组下标表示数值,节点中用0表示这个数 没有,1表示有这个数,判断0或1只用一个bit存储就够了
声明一个可以包含9位整数的bit数组(10亿),一共需要10亿/8=120M内存,把内存中的数据全部初始化 为0 ,读取文件中的数据,并将数据放入内存。比如读到一个数据为这个数据,那就先在内存中找到这个bit,并将bit值 置为1 ,遍历整个bit数组,将bit为1的数组下标存入文件
http://my.oschina.net/bairrfhoinn/blog/209965
算法分析:使用布隆过滤器(Bloom Filter)进行大数据量排序
楼主的问题百度 top-k 或者 top-n就行,论文很多的,代码也不少
.cn/s/blog_55ba8b4601012ken.html
http://www./html/4.htm
/xudong-bupt/archive//2971262.html
一个桶排序,一个计数排序,一个单向判定存在的类字典。和楼主的问题差异大了点吧。&
阅读权限95
在线时间 小时
本帖最后由 Zamyi 于
14:55 编辑
汇铁 发表于
折半查找的代码:
 折半查找,用时:标准:53.8秒;取值:278.508秒。从标准排序看,似乎,这次,程序跑 ...
用单精度浮点型作样本,随机生成数据,I5/4G/XP下只需8.75秒
Public Sub test()
Dim a!(), n&, m&, i&, j&, k1!, k2!, Ma!, mm!
Ma = 10 ^ 6 '数据范围在0~ma之间
n = 10 ^ 8
m = 10 ^ 5
ReDim a(1 To n)
'ReDim aa(1 To n, 0)
t = Timer
For i = 1 To n
&&a(i) = Rnd * Ma
'&&aa(i, 0) = a(i)
Next
[e1] = Timer - t
'[a1].Resize(n) = aa
'Erase aa
t = Timer
k1 = 0: k2 = 1
Do
&&j = 0
&&mm = Ma * (k1 + k2) * 0.5
&&For i = 1 To n
& & If a(i) &= mm Then j = j + 1
&&Next
&&If j & m Then
& & If j & 10 * m Then
& && &k = 0
& && &For i = 1 To n
& && &&&If a(i) &= mm Then k = k + 1: a(k) = a(i)
& && &Next
& && &Exit Do
& & End If
& & If j * 2 & n Then
& && &j = 0
& && &For i = 1 To n
& && &&&If a(i) &= mm Then j = j + 1: a(j) = a(i)
& && &Next
& && &n = j
& & End If
& & k1 = (k1 + k2) * 0.5
&&Else
& & k2 = (k1 + k2) * 0.5
&&End If
&&
Loop
QSort a, 1, j
ReDim Preserve a(1 To m)
[e2] = Timer - t
'ReDim aa(1 To n, 0)
'For i = 1 To m
'&&aa(i, 0) = a(i)
'Next
'[b1].Resize(m) = aa
'Erase aa
End Sub
Sub QSort(a!(), L&, R&)
Dim i&, j&, vm!, v!
nZ = nZ + 1
vm = a((L + R) * 0.5)
i = L
j = R
Do
&&For i = i To j
& & If a(i) &= vm Then Exit For
&&Next
&&For j = j To i Step -1
& & If a(j) &= vm Then Exit For
&&Next
&&If i &= j Then
& & v = a(i)
& & a(i) = a(j)
& & a(j) = v
& & i = i + 1
& & j = j - 1
& & Else
& & Exit Do
&&End If
Loop
If j & L Then QSort a, L, j
If i & R Then QSort a, i, R
End Sub
复制代码
阅读权限100
在线时间 小时
第一部分、十道海量数据处理面试题
1、海量日志数据,提取出某日访问百度次数最多的那个IP。
首先是这一天,并且是访问百度的日志中的IP取出来,逐个写入到一个大文件中。注意到IP是32位的,最多有个2^32个IP。同样可以采用映射的方法, 比如模1000,把整个大文件映射为1000个小文件,再找出每个小文中出现频率最大的IP(可以采用hash_map进行频率统计,然后再找出频率最大 的几个)及相应的频率。然后再在这1000个最大的IP中,找出那个频率最大的IP,即为所求。
或者如下阐述(雪域之鹰):
算法思想:分而治之+Hash
1.IP地址最多有2^32=4G种取值情况,所以不能完全加载到内存中处理;
2.可以考虑采用“分而治之”的思想,按照IP地址的Hash(IP)24值,把海量IP日志分别存储到1024个小文件中。这样,每个小文件最多包含4MB个IP地址;
3.对于每一个小文件,可以构建一个IP为key,出现次数为value的Hash map,同时记录当前出现次数最多的那个IP地址;
4.可以得到1024个小文件中的出现次数最多的IP,再依据常规的排序算法得到总体上出现次数最多的IP;
2、搜索引擎会通过日志文件把用户每次检索使用的所有检索串都记录下来,每个查询串的长度为1-255字节。
& & 假设目前有一千万个记录(这些查询串的重复度比较高,虽然总数是1千万,但如果除去重复后,不超过3百万个。一个查询串的重复度越高,说明查询它的用户越多,也就是越热门。),请你统计最热门的10个查询串,要求使用的内存不能超过1G。
典型的Top K算法,还是在这篇文章里头有所阐述,详情请参见:十一、从头到尾彻底解析Hash表算法。
文中,给出的最终算法是:
第一步、先对这批海量数据预处理,在O(N)的时间内用Hash表完成统计(之前写成了排序,特此订正。July、);
第二步、借助堆这个数据结构,找出Top K,时间复杂度为N‘logK。
即,借助堆结构,我们可以在log量级的时间内查找和调整/移动。因此,维护一个K(该题目中是10)大小的小根堆,然后遍历300万的Query,分别 和根元素进行对比所以,我们最终的时间复杂度是:O(N) + N’*O(logK),(N为1000万,N’为300万)。ok,更多,详情,请参考原文。
或者:采用trie树,关键字域存该查询串出现的次数,没有出现为0。最后用10个元素的最小推来对出现频率进行排序。
3、有一个1G大小的一个文件,里面每一行是一个词,词的大小不超过16字节,内存限制大小是1M。返回频数最高的100个词。
方案:顺序读文件中,对于每个词x,取hash(x)P00,然后按照该值存到5000个小文件(记为x0,x1,…x4999)中。这样每个文件大概是200k左右。
如果其中的有的文件超过了1M大小,还可以按照类似的方法继续往下分,直到分解得到的小文件的大小都不超过1M。
对每个小文件,统计每个文件中出现的词以及相应的频率(可以采用trie树/hash_map等),并取出出现频率最大的100个词(可以用含100个结 点的最小堆),并把100个词及相应的频率存入文件,这样又得到了5000个文件。下一步就是把这5000个文件进行归并(类似与归并排序)的过程了。
4、有10个文件,每个文件1G,每个文件的每一行存放的都是用户的query,每个文件的query都可能重复。要求你按照query的频度排序。
还是典型的TOP K算法,解决方案如下:
顺序读取10个文件,按照hash(query)的结果将query写入到另外10个文件(记为)中。这样新生成的文件每个的大小大约也1G(假设hash函数是随机的)。
找一台内存在2G左右的机器,依次对用hash_map(query, query_count)来统计每个query出现的次数。利用快速/堆/归并排序按照出现次数进行排序。将排序好的query和对应的 query_cout输出到文件中。这样得到了10个排好序的文件(记为)。
对这10个文件进行归并排序(内排序与外排序相结合)。
一般query的总量是有限的,只是重复的次数比较多而已,可能对于所有的query,一次性就可以加入到内存了。这样,我们就可以采用trie树/hash_map等直接来统计每个query出现的次数,然后按出现次数做快速/堆/归并排序就可以了。
与方案1类似,但在做完hash,分成多个文件后,可以交给多个文件来处理,采用分布式的架构来处理(比如MapReduce),最后再进行合并。
5、 给定a、b两个文件,各存放50亿个url,每个url各占64字节,内存限制是4G,让你找出a、b文件共同的url?
方案1:可以估计每个文件安的大小为5G×64=320G,远远大于内存限制的4G。所以不可能将其完全加载到内存中处理。考虑采取分而治之的方法。
遍历文件a,对每个url求取hash(url)00,然后根据所取得的值将url分别存储到1000个小文件(记为a0,a1,…,a999)中。这样每个小文件的大约为300M。
遍历文件b,采取和a相同的方式将url分别存储到1000小文件(记为b0,b1,…,b999)。这样处理后,所有可能相同的url都在对应的小 文件(a0vsb0,a1vsb1,…,a999vsb999)中,不对应的小文件不可能有相同的url。然后我们只要求出1000对小文件中相同的 url即可。
求每对小文件中相同的url时,可以把其中一个小文件的url存储到hash_set中。然后遍历另一个小文件的每个url,看其是否在刚才构建的hash_set中,如果是,那么就是共同的url,存到文件里面就可以了。
方案2:如果允许有一定的错误率,可以使用Bloom filter,4G内存大概可以表示340亿bit。将其中一个文件中的url使用Bloom filter映射为这340亿bit,然后挨个读取另外一个文件的url,检查是否与Bloom filter,如果是,那么该url应该是共同的url(注意会有一定的错误率)。
Bloom filter日后会在本BLOG内详细阐述。
6、在2.5亿个整数中找出不重复的整数,注,内存不足以容纳这2.5亿个整数。
方案1:采用2-Bitmap(每个数分配2bit,00表示不存在,01表示出现一次,10表示多次,11无意义)进行,共需内存2^32 * 2 bit=1 GB内存,还可以接受。然后扫描这2.5亿个整数,查看Bitmap中相对应位,如果是00变01,01变10,10保持不变。所描完事后,查看 bitmap,把对应位是01的整数输出即可。
方案2:也可采用与第1题类似的方法,进行划分小文件的方法。然后在小文件中找出不重复的整数,并排序。然后再进行归并,注意去除重复的元素。
7、腾讯面试题:给40亿个不重复的unsigned int的整数,没排过序的,然后再给一个数,如何快速判断这个数是否在那40亿个数当中?
与上第6题类似,我的第一反应时快速排序+二分查找。以下是其它更好的方法:
方案1:oo,申请512M的内存,一个bit位代表一个unsigned int值。读入40亿个数,设置相应的bit位,读入要查询的数,查看相应bit位是否为1,为1表示存在,为0表示不存在。
dizengrong:
方案2:这个问题在《编程珠玑》里有很好的描述,大家可以参考下面的思路,探讨一下:
又因为2^32为40亿多,所以给定一个数可能在,也可能不在其中;
这里我们把40亿个数中的每一个用32位的二进制来表示
假设这40亿个数开始放在一个文件中。
然后将这40亿个数分成两类:
1.最高位为0
2.最高位为1
并将这两类分别写入到两个文件中,其中一个文件中数的个数&=20亿,而另一个&=20亿(这相当于折半了);
与要查找的数的最高位比较并接着进入相应的文件再查找
再然后把这个文件为又分成两类:
1.次最高位为0
2.次最高位为1
并将这两类分别写入到两个文件中,其中一个文件中数的个数&=10亿,而另一个&=10亿(这相当于折半了);
与要查找的数的次最高位比较并接着进入相应的文件再查找。
以此类推,就可以找到了,而且时间复杂度为O(logn),方案2完。
附:这里,再简单介绍下,位图方法:
使用位图法判断整形数组是否存在重复
判断集合中存在重复是常见编程任务之一,当集合中数据量比较大时我们通常希望少进行几次扫描,这时双重循环法就不可取了。
位图法比较适合于这种情况,它的做法是按照集合中最大元素max创建一个长度为max+1的新数组,然后再次扫描原数组,遇到几就给新数组的第几位置上 1,如遇到5就给新数组的第六个元素置1,这样下次再遇到5想置位时发现新数组的第六个元素已经是1了,这说明这次的数据肯定和以前的数据存在着重复。这 种给新数组初始化时置零其后置一的做法类似于位图的处理方法故称位图法。它的运算次数最坏的情况为2N。如果已知数组的最大值即能事先给新数组定长的话效 率还能提高一倍。
欢迎,有更好的思路,或方法,共同交流。
8、怎么在海量数据中找出重复次数最多的一个?
方案1:先做hash,然后求模映射为小文件,求出每个小文件中重复次数最多的一个,并记录重复次数。然后找出上一步求出的数据中重复次数最多的一个就是所求(具体参考前面的题)。
9、上千万或上亿数据(有重复),统计其中出现次数最多的钱N个数据。
方案1:上千万或上亿的数据,现在的机器的内存应该能存下。所以考虑采用hash_map/搜索二叉树/红黑树等来进行统计次数。然后就是取出前N个出现次数最多的数据了,可以用第2题提到的堆机制完成。
10、一个文本文件,大约有一万行,每行一个词,要求统计出其中最频繁出现的前10个词,请给出思想,给出时间复杂度分析。
方案1:这题是考虑时间效率。用trie树统计每个词出现的次数,时间复杂度是O(n*le)(le表示单词的平准长度)。然后是找出出现最频繁的前10 个词,可以用堆来实现,前面的题中已经讲到了,时间复杂度是O(n*lg10)。所以总的时间复杂度,是O(n*le)与O(n*lg10)中较大的哪一 个。
附、100w个数中找出最大的100个数。
方案1:在前面的题中,我们已经提到了,用一个含100个元素的最小堆完成。复杂度为O(100w*lg100)。
方案2:采用快速排序的思想,每次分割之后只考虑比轴大的一部分,知道比轴大的一部分在比100多的时候,采用传统排序算法排序,取前100个。复杂度为O(100w*100)。
方案3:采用局部淘汰法。选取前100个元素,并排序,记为序列L。然后一次扫描剩余的元素x,与排好序的100个元素中最小的元素比,如果比这个最小的 要大,那么把这个最小的元素删除,并把x利用插入排序的思想,插入到序列L中。依次循环,知道扫描了所有的元素。复杂度为O(100w*100)。
第二部分、十个海量数据处理方法大总结
ok,看了上面这么多的面试题,是否有点头晕。是的,需要一个总结。接下来,本文将简单总结下一些处理海量数据问题的常见方法,而日后,本BLOG内会具体阐述这些方法。
下面的方法全部来自博客,对海量数据的处理方法进行了一个一般性的总结,当然这些方法可能并不能完全覆盖所有的问题,但是这样的一些方法也基本可以处理绝大多数遇到的问题。下面的一些问题基本直接来源于公司的面试笔试题目,方法不一定最优,如果你有更好的处理方法,欢迎讨论。
一、Bloom filter
适用范围:可以用来实现数据字典,进行数据的判重,或者集合求交集
基本原理及要点:
对于原理来说很简单,位数组+k个独立hash函数。将 hash函数对应的值的位数组置1,查找时如果发现所有hash函数对应位都是1说明存在,很明显这个过程并不保证查找的结果是100%正确的。同时也不 支持删除一个已经插入的关键字,因为该关键字对应的位会牵动到其他的关键字。所以一个简单的改进就是 counting Bloom filter,用一个counter数组代替位数组,就可以支持删除了。
还有一个比较重要的问题,如何根据输入元素个数n,确定位数组m的大小及hash函数 个数。当hash函数个数k=(ln2)*(m/n)时错误率最小。在错误率不大于E的情况下,m至少要等于n*lg(1/E)才能表示任意n个元素的集 合。但m还应该更大些,因为还要保证bit数组里至少一半为0,则m应该&=nlg(1/E)*lge 大概就是nlg(1/E)1.44倍(lg表示以2为底的对数)。
举个例子我们假设错误率为0.01,则此时m应大概是n的13倍。这样k大概是8个。
注意这里m与n的单位不同,m是bit为单位,而n则是以元素个数为单位(准确的说是不同元素的个数)。通常单个元素的长度都是有很多bit的。所以使用bloom filter内存上通常都是节省的。
Bloom filter将集合中的元素映射到位数组中,用k(k为哈希函数个数)个映射位是否全1表示元素在不在这个集合中。Counting bloom filter(CBF)将位数组中的每一位扩展为一个counter,从而支持了元素的删除操作。Spectral Bloom Filter(SBF)将其与集合元素的出现次数关联。SBF采用counter中的最小值来近似表示元素的出现频率。
问题实例:给你A,B两个文件,各存放50亿条URL,每条URL占用64字节,内存限制是4G,让你找出A,B文件共同的URL。如果是三个乃至n个文件呢?
根据这个问题我们来计算下内存的占用,4G=2^32大概是40亿*8大概是340 亿,n=50亿,如果按出错率0.01算需要的大概是650亿个bit。现在可用的是340亿,相差并不多,这样可能会使出错率上升些。另外如果这些 urlip是一一对应的,就可以转换成ip,则大大简单了。
二、Hashing
适用范围:快速查找,删除的基本数据结构,通常需要总数据量可以放入内存
基本原理及要点:
hash函数选择,针对字符串,整数,排列,具体相应的hash方法。
碰撞处理,一种是open hashing,也称为拉链法;另一种就是closed hashing,也称开地址法,opened addressing。
d-left hashing中的d是多个的意思,我们先简化这个问题,看一看2-left hashing。2-left hashing指的是将一个哈希表分成长度相等的两半,分别叫做T1和T2,给T1和T2分别配备一个哈希函数,h1和h2。在存储一个新的key时,同 时用两个哈希函数进行计算,得出两个地址h1[key]和h2[key]。这时需要检查T1中的h1[key]位置和T2中的h2[key]位置,哪一个 位置已经存储的(有碰撞的)key比较多,然后将新key存储在负载少的位置。如果两边一样多,比如两个位置都为空或者都存储了一个key,就把新key 存储在左边的T1子表中,2-left也由此而来。在查找一个key时,必须进行两次hash,同时查找两个位置。
问题实例:
1).海量日志数据,提取出某日访问百度次数最多的那个IP。
IP的数目还是有限的,最多2^32个,所以可以考虑使用hash将ip直接存入内存,然后进行统计。
三、bit-map
适用范围:可进行数据的快速查找,判重,删除,一般来说数据范围是int的10倍以下
基本原理及要点:使用bit数组来表示某些元素是否存在,比如8位电话号码
扩展:bloom filter可以看做是对bit-map的扩展
问题实例:
1)已知某个文件内包含一些电话号码,每个号码为8位数字,统计不同号码的个数。
8位最多99 999 999,大概需要99m个bit,大概10几m字节的内存即可。
2)2.5亿个整数中找出不重复的整数的个数,内存空间不足以容纳这2.5亿个整数。
将bit-map扩展一下,用2bit表示一个数即可,0表示未出现,1表示出现一次,2表示出现2次及以上。或者我们不用2bit来进行表示,我们用两个bit-map即可模拟实现这个2bit-map。
适用范围:海量数据前n大,并且n比较小,堆可以放入内存
基本原理及要点:最大堆求前n小,最小堆求前n大。方法,比如求前n小,我们比较当前 元素与最大堆里的最大元素,如果它小于最大元素,则应该替换那个最大元素。这样最后得到的n个元素就是最小的n个。适合大数据量,求前n小,n的大小比较 小的情况,这样可以扫描一遍即可得到所有的前n元素,效率很高。
扩展:双堆,一个最大堆与一个最小堆结合,可以用来维护中位数。
问题实例:
1)100w个数中找最大的前100个数。
用一个100个元素大小的最小堆即可。
五、双层桶划分—-其实本质上就是【分而治之】的思想,重在“分”的技巧上!
适用范围:第k大,中位数,不重复或重复的数字
基本原理及要点:因为元素范围很大,不能利用直接寻址表,所以通过多次划分,逐步确定范围,然后最后在一个可以接受的范围内进行。可以通过多次缩小,双层只是一个例子。
问题实例:
1).2.5亿个整数中找出不重复的整数的个数,内存空间不足以容纳这2.5亿个整数。
有点像鸽巢原理,整数个数为2^32,也就是,我们可以将这2^32个数,划分为2^8个区域(比如用单个文件代表一个区域),然后将数据分离到不同的区域,然后不同的区域在利用bitmap就可以直接解决了。也就是说只要有足够的磁盘空间,就可以很方便的解决。
2).5亿个int找它们的中位数。
这个例子比上面那个更明显。首先我们 将int划分为2^16个区域,然后读取数据统计落到各个区域里的数的个数,之后我们根据统计结果就可以判断中位数落到那个区域,同时知道这个区域中的第 几大数刚好是中位数。然后第二次扫描我们只统计落在这个区域中的那些数就可以了。
实际上,如果不是int是int64,我们可以经过3次这样的划分即可降低到可以接受 的程度。即可以先将int64分成2^24个区域,然后确定区域的第几大数,在将该区域分成2^20个子区域,然后确定是子区域的第几大数,然后子区域里 的数的个数只有2^20,就可以直接利用direct addr table进行统计了。
六、数据库索引
适用范围:大数据量的增删改查
基本原理及要点:利用数据的设计实现方法,对海量数据的增删改查进行处理。
七、倒排索引(Inverted index)
适用范围:搜索引擎,关键字查询
基本原理及要点:为何叫倒排索引?一种索引方法,被用来存储在全文搜索下某个单词在一个文档或者一组文档中的存储位置的映射。
以英文为例,下面是要被索引的文本:
T0 = “it is what it is”
T1 = “what is it”
T2 = “it is a banana”
我们就能得到下面的反向文件索引:
“a”:& && &{2}
“banana”: {2}
“is”:& &&&{0, 1, 2}
“it”:& &&&{0, 1, 2}
“what”:& &{0, 1}
检索的条件”what”,”is”和”it”将对应集合的交集。
正向索引开发出来用来存储每个文档的单词的列表。正向索引的查询往往满足每个文档有序 频繁的全文查询和每个单词在校验文档中的验证这样的查询。在正向索引中,文档占据了中心的位置,每个文档指向了一个它所包含的索引项的序列。也就是说文档 指向了它包含的那些单词,而反向索引则是单词指向了包含它的文档,很容易看到这个反向的关系。
问题实例:文档检索系统,查询那些文件包含了某单词,比如常见的学术论文的关键字搜索。
八、外排序
适用范围:大数据的排序,去重
基本原理及要点:外排序的归并方法,置换选择败者树原理,最优归并树
问题实例:
1).有一个1G大小的一个文件,里面每一行是一个词,词的大小不超过16个字节,内存限制大小是1M。返回频数最高的100个词。
这个数据具有很明显的特点,词的大小为16个字节,但是内存只有1m做hash有些不够,所以可以用来排序。内存可以当输入缓冲区使用。
九、trie树
适用范围:数据量大,重复多,但是数据种类小可以放入内存
基本原理及要点:实现方式,节点孩子的表示方式
扩展:压缩实现。
问题实例:
1).有10个文件,每个文件1G,每个文件的每一行都存放的是用户的query,每个文件的query都可能重复。要你按照query的频度排序。
2).1000万字符串,其中有些是相同的(重复),需要把重复的全部去掉,保留没有重复的字符串。请问怎么设计和实现?
3).寻找热门查询:查询串的重复度比较高,虽然总数是1千万,但如果除去重复后,不超过3百万个,每个不超过255字节。
十、分布式处理 mapreduce
适用范围:数据量大,但是数据种类小可以放入内存
基本原理及要点:将数据交给不同的机器去处理,数据划分,结果归约。
问题实例:
1).The canonical example application of MapReduce is a process to count the appearances of
each different word in a set of documents:
2).海量数据分布在100台电脑中,想个办法高效统计出这批数据的TOP10。
3).一共有N个机器,每个机器上有N个数。每个机器最多存O(N)个数并对它们操作。如何找到N^2个数的中数(median)?
阅读权限95
在线时间 小时
说明一下,33楼用的是升序排序,结果需从j-1至1取10W个才正确。
最新热点 /1
ExcelHome每周都有线上直播公开课,
国内一流讲师真身分享,高手贴身答疑,
赶不上直播还能看录像,
关键居然是免费的!
厚木哥们都已经这么努力了,
你还好意思说学不好Office。
玩命加载中,请稍候
玩命加载中,请稍候
Powered by
本论坛言论纯属发表者个人意见,任何违反国家相关法律的言论,本站将协助国家相关部门追究发言者责任! & & 本站特聘法律顾问:徐怀玉律师 李志群律师

我要回帖

更多关于 用weka进行数据预处理 的文章

 

随机推荐