Excel查重全指南:从条件格式到Python模糊匹配

处理Excel数据的时候,相信大家都遇到过这种需求:从一份几千行甚至上万行的表格里,找出重复的记录。单纯的“完整重复”其实好办,Excel自带的删除重复项按钮就能解决,但现实中更让人头疼的,是那些“看着像重复、仔细看又不太一样”的近似文本——同一个客户两次登记,一次写“张三”,一次写“张三 ”(多了个空格);同一个公司,一次写“北京华信科技有限公司”,一次写“北京华信科技有限责任公司”。在Excel文件里找出完整的或者近似的重复文本行,就是要把这两类问题都解决掉,而不是只处理表面那一层。

这篇文章不打算讲太多虚的,我直接把整个思路拆开给你看:从最简单的Excel自带功能,到公式函数、Power Query、VBA编辑距离算法,再到Python批量模糊匹配,按难度递进,每一层都能落地用。适合常年跟Excel打交道的运营、数据分析、财务、销售管理,以及所有被重复数据折磨过的朋友。不管你是只会点按钮的Excel新手,还是能写代码的进阶用户,都能在里面找到自己能用的那一招。

1. 先搞清楚问题:你面对的是哪一类“重复”

1.1 完整重复与近似重复,处理逻辑完全不同

在动手之前,最好先把“重复”定义清楚。我见过太多人拿到需求就直接上删除重复项,结果删完发现数据丢了,或者该删的没删掉,原因就是没分清重复的类型。

完整重复,指的是两行文本经过常规对比后完全一致,比如“深圳市南山区科技园”和“深圳市南山区科技园”,一摸一样。这种重复删除风险低,机器可以放心处理。

近似重复,指的是两行文本存在差异,但差异小到基本可以断定是同一实体。常见的原因有几种:一个是录入差异,比如“李四”和“李四 ”之间有个全角空格;一个是格式差异,比如“1234567890”和“123-456-7890”;还有一个是表述差异,比如公司名称里的“有限公司”和“股份有限公司”,或者地址里“3栋”和“三栋”这样的差异。

这两类重复的处理方式差异很大。完整重复用Excel原生功能就能暴力解决,近似重复则需要引入相似度计算,也就是说,你得定义“多像才算重复”。通常我用两个指标:编辑距离(把一条文本改成另一条需要多少次增删改操作)和相似度百分比(编辑距离除以最大文本长度,再换算成百分比)。相似度达到90%以上,基本可以认为是重复;80%到90%之间的,需要人工重点看一眼。

1.2 为什么“看起来完全一样”的两行,Excel却判定不重复

这个问题困扰了很多人。明明肉眼看着就是一样的文字,条件格式却不标红,删除重复项也不删。我排查过很多次,背后原因基本是这几个:

一是不可见字符。最常见的是CHAR(160),也就是不换行空格,经常从网页或PDF复制过来时混入,肉眼看不出来,但Excel认为它跟普通空格是不同的字符。二是全角半角差异。中文标点和英文标点、全角数字和半角数字在Excel的精确匹配里是两个东西。三是大小写问题。英文字母的大小写,Excel的常规重复判断会区分。四是数字与文本格式混用。单元格里一个存的是数字,一个存的是文本格式的数字,表面看着一样,实际上底层值不同。五是公式结果。如果单元格是公式生成的,Excel删除重复项时按公式计算后的值判断,但条件格式判断逻辑有时会受制于单元格格式。

做任何去重操作之前,我强烈建议先做一次数据清洗,把空格、不可见字符、全角半角统一掉,这能让后面所有步骤都省心很多。

1.3 去重前先想清楚规则,别急着删数据

还有一点比技术更重要:业务规则。同一个客户出现两条记录,到底保留哪一条?这取决于你的业务场景。如果是订单表,可能保留金额最大的那条;如果是客户表,可能保留最早创建的那条,因为注册时间更可信;如果是联系人表,可能两条信息要合并,把缺失的字段补全。

这个规则必须在操作之前定好,因为无论是Excel删除重复项,还是Python去重,默认都是“保留第一条”。如果第一条恰好是最不完整的记录,那你删完就麻烦了。我习惯的做法是:先在原表右侧加一列辅助列,标记每一行是不是重复、重复组里的第几条、保留还是不保留,全部确认完之后,再筛选出来删除。这样每一步都有据可查,误删了也能恢复。

需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。

2. 零门槛方案:用Excel自带功能处理完整重复

2.1 条件格式高亮重复,先看再删

对于完整重复,最快速的方法是使用条件格式。选中数据区域,点击“开始”选项卡里的“条件格式”,选择“突出显示单元格规则”,再选“重复值”,Excel会把你所选区域里重复出现的单元格自动标色。

这里有个坑:条件格式的重复值判断是“单列内重复”,不是“整行重复”。如果你的业务判断标准是“姓名+手机号+公司名”三列完全相同才算重复,那直接选三列区域去标重复会得到错误结果——因为只要姓名出现重复,就会被标出来,哪怕电话和公司都不同。

正确的做法是先加辅助列。假设数据在A、B、C三列,在D1输入公式:

excel复制=A2&"|"&B2&"|"&C2

把三列内容拼接成一个整体,再用条件格式对D列做重复值判断。拼接的时候加一个竖线分隔符,是为了避免“AB”+“C”和“A”+“BC”这种边界模糊导致误判。这样标出来的才是真正整行重复的记录。

2.2 删除重复项功能,动手前先备份

如果你确认要删除完整重复的行,可以用“数据”选项卡里的“删除重复项”。弹窗里会让你勾选依据哪些列来判断重复,这时候千万别全选。如果你把“客户ID”也勾上了,而ID本身是唯一的,那结果就是一条都不删。

删除重复项的机制是:保留每组重复记录中的第一条,其余删除。操作不可用Ctrl+Z撤销的情况在不同Excel版本里不一定相同,所以务必先复制一份工作表备份,或者把数据复制到一个新工作簿里再操作。我个人的习惯是,在操作之前先把整张表复制一份,放到相同工作簿的最后面,命名为“备份-删除前”,等确认结果无误之后再删掉这个备份sheet。

2.3 用COUNTIF函数统计每条记录的重复次数

条件格式适合看,COUNTIF适合算。如果你想在表格里增加一列,标明每行重复了几次,可以用这个公式:

excel复制=COUNTIF(A:A, A2)

结果大于1的,说明是重复记录。这个方法的好处是:你可以按重复次数排序,把重复最多的记录排到最前面优先处理;也可以配合筛选功能,只把重复次数大于1的行筛出来单独看。

不过COUNTIF有一个典型缺陷:如果文本超过15位数字,比如身份证号、银行卡号,Excel会自动把超出部分当作0处理,导致两个只有末尾几位不同的长数字被误判为重复。解决办法是给条件加通配符,把公式写成:

excel复制=COUNTIF(A:A, A2&"*")

强制把A2当文本处理。还有一种情况是多列联合判断,要用COUNTIFS:

excel复制=COUNTIFS(A:A, A2, B:B, B2, C:C, C2)

如果这个结果大于1,说明这三列联合起来出现了重复。

3. 公式函数方案:精确重复的深度清洗与轻量近似

3.1 条件格式和删除重复项解决不了的问题

Excel自带的重复判断,本质上都是精确匹配。但前文说了,真实数据里到处都是“隐性重复”:带空格、全角半角混用、大小写不一致。这时候就要靠公式先做清洗,清洗完了再判断重复。

我给这个方法起了个名字叫“归一化判断”。思路不复杂:把每行文本统一处理成标准格式,再基于标准化之后的文本做重复判断。这样“张三 ”和“张三”就会归一化成同一个值,自然就能被识别为重复。

3.2 文本清洗三件套:TRIM、CLEAN、SUBSTITUTE

Excel里有三个函数专门处理文本脏数据:

TRIM函数负责去掉文本首尾的空格,以及单词之间多余的空格,但不能去掉不换行空格(CHAR(160))。CLEAN函数负责去掉文本中的非打印字符,比如换行符、制表符、某些从网页复制过来的乱码字符。SUBSTITUTE函数负责把指定字符替换成别的,比如把全角空格替换成空字符串,或者把中文标点替换成英文标点。

对于常规数据,我一般这样组合:

excel复制=TRIM(CLEAN(A2))

如果发现清理之后还有问题,排查思路是先用CODE函数逐个字符看:

excel复制=CODE(MID(A2, 5, 1))

这个公式会返回第5个字符的字符码。如果是160,就是不换行空格,用SUBSTITUTE单独处理:

excel复制=SUBSTITUTE(A2, CHAR(160), "")

全角半角转换在Excel公式里没有一键函数,但可以用SUBSTITUTE逐个替换。比如全角逗号“,”替换成半角逗号“,”,全角括号“()”替换成半角“()”。如果全角数字多,还是建议用后面讲到的VBA或Python处理,效率高得多。

3.3 轻量级近似匹配:用LEFT、LEN和通配符VLOOKUP

Excel公式虽然不能直接算编辑距离,但应付一些简单的近似匹配场景还是够用的。

比如你想查“前5个字符相同”的记录,可以用LEFT函数配合COUNTIF:

excel复制=COUNTIF(A:A, LEFT(A2,5)&"*")

如果结果大于1,说明前5个字符相同的记录不止一条,需要人工看看是不是重复。

还有一种场景是关键词匹配。用VLOOKUP加通配符:

excel复制=VLOOKUP("*"&重要关键词&"*", B:B, 1, FALSE)

可以判断目标区域里是否存在包含某个关键词的单元格。这个方法适用于“查找公司名称包含‘华信’的记录”。

另外可以用LEN和SUBSTITUTE组合,计算两条文本的字符数差异比例,做很粗糙的相似度判断:

excel复制=1 - ABS(LEN(A2) - LEN(B2)) / MAX(LEN(A2), LEN(B2))

这个公式只能判断长度接近程度,不能判断内容相似度,但可以作为预筛选,把长度差异太大的组合直接排除掉,减少人工复查的量。

4. Power Query和数据透视表:适合大表格的完整重复处理

4.1 Power Query做可重复使用的清洗流程

当你的数据量到几万行,而且每隔几天就要重新处理一次,再靠公式和手动操作就不太合适了。Power Query可以帮你把清洗步骤记录成流程,下次直接刷新就能得到同样的结果。

操作路径是:选中数据区域,点击“数据”选项卡里的“来自表格/区域”,进入Power Query编辑器。在编辑器里做三件核心事。

第一件是清洗:在“转换”菜单里选择“修整”(去除首尾空格)和“清除”(去除非打印字符)。第二件是去重:点击“删除重复项”,Power Query会按当前所有列的组合判断重复,只保留每组第一条。第三件是导出:点击“关闭并加载”,把清洗后的数据加载回Excel工作表。

这个方案的真正好处可以重复。你下次拿到同样格式的新数据,只要把新数据粘贴到原表区域,再点一下“刷新”,Power Query会把整套清洗和去重流程重新跑一遍,不用再动手操作。对于每周要处理一次报表的人来说,这能省下大量时间。

4.2 用数据透视表快速定位重复组

数据透视表也能做去重统计,而且很多时候比删除重复项更直观。把需要判断重复的字段拖到“行”区域,再把一个唯一字段(比如ID)拖到“值”区域,计数结果大于1的,就是重复的记录组。

举例来说,你想看“公司名称”里哪些出现了多次,透视表一拉就出来了,双击计数为2的那一行,Excel会在新sheet里列出对应的所有明细记录,方便你逐条核对。

这个方法的优势是:不删除任何数据,只看统计结果,非常安全。适合先摸清重复情况,再决定下一步动作的场景。

4.3 拼接辅助列的进阶用法

前面提到过用辅助列拼接多列判断重复,这个方法在Power Query里更灵活。在Power Query里点击“添加列”下的“自定义列”,写入:

powerquery复制[姓名] & "|" & [手机号] & "|" & [公司]

然后把这一列作为去重依据。在实际项目中,我还经常用分隔符拼接“城市+详细地址+门牌号”来定位重复门店,或者用“订单编号+商品编码”来识别重复下单记录。拼接的目的是把业务上的联合唯一键转化成单一字段,这样Excel的各种重复判断工具才能正确处理。

5. 近似重复的硬核解法:VBA编辑距离算法

5.1 编辑距离的原理,用一句人话讲清楚

如果你需要在Excel里直接做近似匹配,又不想装Python环境,VBA是最现实的方案。核心算法我推荐编辑距离,也叫Levenshtein Distance。

概念很简单:把字符串A变成字符串B,最少需要多少次插入、删除、替换操作。比如“abc”变成“abd”,只需要把最后一个字符从c换成d,操作1次,编辑距离就是1。两条文本越长、编辑距离越小,相似度就越高。

相似度的计算公式常用的是:

text复制相似度 = 1 - 编辑距离 / 两文本中较长者的长度

“中国人民”和“中国人”的编辑距离是1,最大长度是4,相似度就是1 - 1/4 = 75%。“中国人们”和“中国人民”编辑距离是2(换一字、加一字),最大长度是4,相似度50%。实际使用中,我会把阈值设定在80%到85%以上才算疑似重复,75%到80%的列为人工抽查范围。

这个方法对“多字少字”“个别错字”“顺序颠倒”比较敏感,尤其是顺序颠倒,比如“中国银行北京分行”和“北京分行中国银行”,直接在编辑距离下相似度不高,因为每个字的位置都变了。针对这类问题,后面会提到Jaccard相似度配合使用。

5.2 在Excel里启用VBA并写入编辑距离函数

按Alt+F11打开VBA编辑器,在“插入”菜单中选择“模块”,把下面的代码粘贴进去:

vba复制Function Levenshtein(s1 As String, s2 As String) As Long
    Dim i As Long, j As Long
    Dim len1 As Long, len2 As Long
    Dim cost As Long
    Dim d() As Long

    len1 = Len(s1)
    len2 = Len(s2)

    If len1 = 0 Then
        Levenshtein = len2
        Exit Function
    End If
    If len2 = 0 Then
        Levenshtein = len1
        Exit Function
    End If

    ReDim d(0 To len1, 0 To len2)

    For i = 0 To len1
        d(i, 0) = i
    Next i
    For j = 0 To len2
        d(0, j) = j
    Next j

    For i = 1 To len1
        For j = 1 To len2
            If Mid(s1, i, 1) = Mid(s2, j, 1) Then
                cost = 0
            Else
                cost = 1
            End If
            d(i, j) = Application.WorksheetFunction.Min( _
                d(i - 1, j) + 1, _
                d(i, j - 1) + 1, _
                d(i - 1, j - 1) + cost)
        Next j
    Next i

    Levenshtein = d(len1, len2)
End Function

Function TextSimilarity(s1 As String, s2 As String) As Double
    Dim maxLen As Long
    maxLen = Application.WorksheetFunction.Max(Len(s1), Len(s2))
    If maxLen = 0 Then
        TextSimilarity = 1
    Else
        TextSimilarity = 1 - Levenshtein(s1, s2) / maxLen
    End If
End Function

这段代码里,Levenshtein函数返回两个字符串之间的编辑距离,TextSimilarity函数把它换算成0到1之间的相似度。用的时候,在任意单元格输入:

excel复制=TextSimilarity(A2, B2)

就能看到两条文本的相似度。比如A2是“北京华信科技有限公司”,B2是“北京华信科技股份有限公司”,返回结果大概率在0.9以上,基本可以判定为同一家公司。

5.3 用VBA批量扫描全表,找出相似度超过阈值的行对

只有相似度函数还不够,你得能遍历整个工作表。我写了一个批量扫描的宏,用来找出指定列中所有相似度超过设定阈值的行对,并把结果输出到新工作表中:

vba复制Sub FindSimilarRows()
    Dim rng As Range
    Dim i As Long, j As Long, lastRow As Long
    Dim outRow As Long
    Dim threshold As Double
    Dim wsData As Worksheet, wsOut As Worksheet

    Set wsData = ActiveSheet
    lastRow = wsData.Cells(wsData.Rows.Count, "A").End(xlUp).Row
    Set rng = wsData.Range("A1:A" & lastRow)

    threshold = 0.85

    Set wsOut = Sheets.Add
    wsOut.Range("A1:E1").Value = Array("行号1", "行号2", "文本1", "文本2", "相似度")
    outRow = 2

    For i = 1 To lastRow
        For j = i + 1 To lastRow
            If Abs(Len(wsData.Cells(i, 1).Value) - Len(wsData.Cells(j, 1).Value)) <= 5 Then
                If TextSimilarity(wsData.Cells(i, 1).Value, wsData.Cells(j, 1).Value) >= threshold Then
                    wsOut.Cells(outRow, 1).Value = i
                    wsOut.Cells(outRow, 2).Value = j
                    wsOut.Cells(outRow, 3).Value = wsData.Cells(i, 1).Value
                    wsOut.Cells(outRow, 4).Value = wsData.Cells(j, 1).Value
                    wsOut.Cells(outRow, 5).Value = Round(TextSimilarity(wsData.Cells(i, 1).Value, wsData.Cells(j, 1).Value), 4)
                    outRow = outRow + 1
                End If
            End If
        Next j
    Next i

    wsOut.Columns.AutoFit
    MsgBox "扫描完成,共找到 " & outRow - 2 & " 组疑似重复。"
End Sub

这段代码先用 Abs(Len(...) - Len(...)) <= 5 做了一次快速过滤。原因是,两条文本长度差异超过5个字符的,中文文本相似度很难再超过85%,直接跳过能省下大量计算时间。这个优化非常重要,因为编辑距离算法本身是O(n*m)的,如果遍历所有行对,1000行的数据就要比较约50万次,不做预筛会卡到怀疑人生。

5.4 VBA方案的适用边界和注意事项

VBA方案适合几千行以内的数据。超过一两万行,两两比较的耗时就会指数级上升,哪怕是加了长度过滤也很吃力。另外,VBA的每次运算都会刷新屏幕,建议在宏开头加上这几句:

vba复制Application.ScreenUpdating = False
Application.Calculation = xlManual

宏运行完再恢复:

vba复制Application.ScreenUpdating = True
Application.Calculation = xlAutomatic

还有一个无法避免的问题:VBA中一旦执行宏修改了数据,撤销功能基本就失效了。所以运行批量扫描宏之前,务必备份。输出结果也不要直接覆盖原数据,而是放到新工作表里,人工确认后再动手处理。

对于词序打乱的情况,比如“深圳市腾讯计算机系统有限公司”和“腾讯计算机系统有限公司深圳”,编辑距离会给出一个偏低的相似度,但它俩明显是同一主体。这种情况下可以用Jaccard相似度来补充,思路是把文本拆成字符集合或者词集合,然后计算交集和并集的比例。不过完整的Jaccard实现代码量更大,如果你经常处理这种“字段顺序颠倒”的数据,我更推荐直接跳到下面用Python的token_sort_ratio。

6. Python方案:pandas加文本相似度库,一次性解决所有问题

6.1 环境准备,装好该装的库

如果你的数据量到了几万行、几十万行,或者需要处理的不是一两次而是一整套重复性问题,请直接切换到Python。Python处理Excel查重,核心是三个库的组合:pandas负责表格读写和结构操作,openpyxl负责读写xlsx文件,rapidfuzz负责高性能的模糊匹配。

安装命令如下:

bash复制pip install pandas openpyxl rapidfuzz

如果你用的是Anaconda环境,pandas通常已经装好了,只需要补装openpyxl和rapidfuzz。这里我特意选了rapidfuzz而不是fuzzywuzzy,是因为rapidfuzz是fuzzywuzzy的C语言加速版,速度能快几十倍,处理大批量数据时体感差距非常明显,而且接口基本兼容。

6.2 完整重复检测,一行代码搞定

用pandas读入Excel之后,先做一次完整重复检测:

python复制import pandas as pd

df = pd.read_excel("客户名单.xlsx", sheet_name="明细")

# 查看哪些行是重复的
duplicated_mask = df.duplicated(subset=["姓名", "手机号", "公司名称"], keep=False)
duplicated_rows = df[duplicated_mask].sort_values(by=["姓名", "手机号"])

# 删除完全重复的行,只保留第一条
df_deduplicated = df.drop_duplicates(subset=["姓名", "手机号", "公司名称"], keep="first")

参数keep有三个选项:keep=False保留所有重复行的标记,方便你查看;keep="first"删除重复行时保留第一条;keep="last"保留最后一条。

从实际项目经验看,重复检测完成后,最好先输出一份“重复明细表”人工确认,而不是直接删除。因为有些行在其他字段上存在差异,比如两条记录的姓名手机号相同,但一条填了邮箱、一条没填,这种情况可能需要合并而不是删除。

6.3 归一化处理,让“看起来不同”的文本变成同一个值

我在Excel公式那一节里提到过归一化,用Python实现起来更彻底。下面这个函数是我处理中文文本去重的标配:

python复制import re

def normalize(text):
    if not isinstance(text, str):
        text = str(text)
    # 统一转小写
    text = text.lower()
    # 全角转半角
    result = []
    for ch in text:
        code = ord(ch)
        if code == 12288:  # 全角空格
            code = 32
        elif 65281 <= code <= 65374:  # 全角字符范围
            code -= 65248
        result.append(chr(code))
    text = "".join(result)
    # 去掉所有空白字符
    text = re.sub(r"\s+", "", text)
    # 去掉常见中英文标点
    text = re.sub(r"[,。!?、;:""''()【】《》\-—_,.!?;:()\[\]<>/]", "", text)
    return text

处理后,“张三 ”会变成“张三”,“3号院”会变成“3号院”,“深圳南山科技园!”会变成“深圳南山科技园”。你只需要在原始DataFrame后面加一列:

python复制df["姓名_NORM"] = df["姓名"].map(normalize)

然后基于 姓名_NORM 这一列做重复检测。这样之前Excel里怎么都查不出来的隐性重复,就被彻底暴露出来了。

如果处理的公司名里有繁体字,还可以用opencc库做简繁转换。安装方式:

bash复制pip install opencc-python-reimplemented

归一化在手动流程里往往会被忽略,但它是决定去重质量的关键一步。很多时候客户抱怨“我用Excel查重了,怎么还是漏了”,问题就出在这里——原始文本根本没被清洗过,相似度算法再准也白搭。

6.4 近似匹配:rapidfuzz的三种相似度算法对比

rapidfuzz里有几个函数,适合不同场景。最常用的是fuzz.ratio、fuzz.token_sort_ratio和fuzz.token_set_ratio。

fuzz.ratio是基础相似度,直接比较两个字符串的字面相似度,适合判断错别字、多字少字的情况。fuzz.token_sort_ratio会先把文本拆成词,排序后再比较,适合词序颠倒但内容相同的情况,比如“中国银行北京分行”和“北京分行中国银行”。fuzz.token_set_ratio则是把两个文本的共同词和差异词分开计算,适合一条文本是另一条子集的情况,比如“腾讯科技”和“深圳市腾讯计算机系统有限公司”。

实际的配合策略是:中文人名、地址用fuzz.ratio,公司名称、机构名称用fuzz.token_sort_ratio。也可以把三个score都算出来,取最大值作为最终相似度。

6.5 批量近似匹配的完整代码

下面是一段可以直接跑的批量近似匹配脚本。它会读取Excel中的某一列文本,两两比较相似度,把超过阈值的行对输出到新工作表:

python复制import pandas as pd
from rapidfuzz import fuzz

df = pd.read_excel("客户名单.xlsx", sheet_name="明细")
df["姓名_NORM"] = df["姓名"].map(normalize)
records = df["姓名_NORM"].tolist()
threshold = 85

results = []
for i in range(len(records)):
    for j in range(i + 1, len(records)):
        score = fuzz.ratio(records[i], records[j])
        if score >= threshold:
            results.append({
                "行号1": i + 2,
                "行号2": j + 2,
                "文本1": df.loc[i, "姓名"],
                "文本2": df.loc[j, "姓名"],
                "相似度": round(score, 2)
            })

result_df = pd.DataFrame(results)
result_df.sort_values("相似度", ascending=False, inplace=True)
result_df.to_excel("疑似重复结果.xlsx", index=False)
print(f"共找到 {len(result_df)} 组疑似重复")

这段代码直接写在.py文件里运行就行。注意事项:如果有几千行,两两比较就是几百万次运算,会有点慢。优化办法是先把记录按长度排序,只比较长度接近的记录;或者先按首字母、首字分组,只在同组内比较。我常用的优化是先做一层简单的长度过滤:

python复制for i in range(len(records)):
    for j in range(i + 1, len(records)):
        if abs(len(records[i]) - len(records[j])) > 5:
            continue

这样能直接跳过大量不太可能相似的组合,速度能快一个数量级。

6.6 性能和稳定性优化,防呆设计不能少

处理大文件时,pandas的read_excel是整体读入内存的,如果你的Excel有几十万行,可能会把内存占满。可以用参数控制读取指定的行或列:

python复制df = pd.read_excel("大文件.xlsx", sheet_name="数据", usecols=["姓名", "电话"], nrows=50000)

文本相似度计算是计算密集型任务,对于10万行以上的数据,建议直接放弃两两比较的思路,改用分桶加局部匹配的策略:先按文本长度分成若干桶,比如“5-8字符”“9-12字符”这样,只在同桶内做两两比较。因为真实业务中,同一条记录的变体长度不会差太多,这么做能把计算量降几个数量级。

另外,输出之后的人工复核环节一定不能省。相似度85分以上的,可能有5%到10%不是真正重复,比如“南京大学”和“东南大学”,字面相似度高但完全是两个实体。这个锅算法不背,因为文本本身雷同但语义不同,所以在交付结果时,我会在报告里加三列:自动判定结果、人工复核结果、处理意见。这样责任清晰、可追溯。

7. 实战复盘:一份12000行客户名单的完整查重过程

7.1 把整个流程串起来

前面讲了不少工具和技巧,我拿一个真实项目从头到尾走一遍,你就能明白这些方法具体怎么配合使用。

当时接手的是某公司的客户信息表,一共12000多行,字段有客户ID、姓名、电话、公司名称、地址、登记时间。业务方的诉求听起来很简单:“把重复客户找出来,一个客户只能留一条。”但检查数据之后发现,情况远没有这么简单。

抽样看了一些数据,存在好几类问题:同一个客户的电话,有的写“13812345678”,有的写“138-1234-5678”;同一家公司,有的写“北京华信科技有限公司”,有的写“华信科技北京有限公司”;还有些记录从系统导出时姓名后面带了不可见字符,肉眼完全看不出来,但COUNTIF判断就是不重复。

7.2 第一轮:完整重复检测,干掉最明显的

第一步是把所有文本字段做归一化,生成标准列。我用Python写好normalize函数,给姓名、电话、公司、地址四列各生成一列归一化结果。

第二步基于“归一化姓名+归一化电话+归一化公司”三列做精确去重,找出完全相同的记录。这一步直接定位出487组完全重复,涉及986行,约占数据总量8%。这些用Excel的删除重复项也能完成,但因为要先做清洗,所以我直接用Python处理。

处理结果我先没有直接删,而是生成了一个明细sheet,包含重复组编号、行号、各列内容、登记时间。通过人工抽查,确认这486组里大部分是系统重复导入造成的,保留原则定为“保留登记时间最早的那条,其余标记为删除”。

7.3 第二轮:近似匹配,抓出“看起来不同”的重复

完整重复处理完之后,第二阶段是看近似重复。我分成三个维度来查。

第一个维度是电话号码。把电话字段先去掉所有非数字字符,然后基于纯数字号码做精确匹配。结果发现37组电话相同的记录,但姓名不同。这些不是误匹配,而是同一人用不同名字登记了多次,比如“张伟”和“张玮”,读音相同、电话相同,判定为重复。

第二个维度是公司名称。用fuzz.token_sort_ratio计算相似度,阈值设为85。这里token排序版算法派上了大用场,因为公司名经常存在词序调整的情况。筛出来140多组疑似重复,其中约一半是同一公司在不同时期的名称登记变体。

第三个维度是地址。地址比较特殊,用相似度算法容易误判,因为“北京市朝阳区某某路1号”和“北京市朝阳区某某路2号”相似度很高,但其实是两个不同的地址。所以我只对地址做了长度过滤加关键词初筛,找出“同街道+同号段+相似度高于90”的组合,再人工确认。

7.4 第三轮:人工复核和兜底规则

自动匹配跑完,所有疑似重复输出到Excel复核表,包含完整的三类信息:原始行号、各字段内容、相似度得分。我按相似度从高到低排序,高分段(95以上)快速批量确认,中分段(85到95)逐条看,低分段(80到85)基本跳过,只随机抽查。

人工复核阶段发现几个典型的误判案例:公司原名和变更后的名称被标记为重复,但业务上可能需要保留两条历史记录;相同地址但实际是两家不同公司在同栋楼办公,这个靠电话和公司名来二次判断;姓名相似但电话不同的两条记录,实际是两位不同客户。

最后汇总,确认需要合并或删除的重复记录共640多条。最终清洗后的有效客户数从12000多行降到11300多行,整体重复率约6%。整个过程,从写脚本到复核完成,大约耗时大半天。如果完全靠人工肉眼逐行核对,这个量级至少需要一整周,而且漏查率会很高。

7.5 这个案例给到我的三个经验

第一个经验是,归一化处理的价值大于相似度算法。只要清洗做到位,很多近似问题会直接变成完整重复问题,计算量小、准确率还高。第二个经验是,最终判定必须有人工参与。算法只是把疑似重复的范围从12000行缩小到几百行,真正的合并与删除决策还是依赖业务规则和人脑判断。第三个经验是,结果要留痕。每一行保留或删除的理由要能被追溯,否则三个月后业务方质疑你的数据,你连当初为什么这么处理都说不清楚,会很被动。

8. 常见问题排查与避坑技巧

8.1 为什么条件格式标出来的重复不准

条件格式的重复值判断是基于所选区域的精确匹配。一个常见的误区是,直接选整列区域,结果只有一个单元格被标出来,但实际上其他行也有重复。这是因为只选了A列,Excel判断的是这一列里有没有完全相同的值,但相同值不一定在相邻行,条件格式默认只对重复出现的值标色,理论上是都能标出来的。如果遇到标不全的情况,常见原因还是文本有隐藏字符或格式差异,先做清洗再看。

8.2 同样内容,为什么删除重复项删不掉

前面反复提到过不可见字符和格式差异,这里再补充一个容易被忽略的坑:日期和数值的底层值。比如“2024/1/15”和“2024/1/15 ”在单元格里看起来一样,但一个是日期类型,一个是文本类型,底层存储完全不同。还有比如“00123”和“123”,Excel里数字格式会吃掉前导零,导致你看着是两行,实际存储值是一个。

这类问题的排查方法是,在某一列旁边用公式:

excel复制=TYPE(A2)

TYPE函数会返回1表示数字、2表示文本。如果两条记录看起来一样但TYPE结果不同,说明一个是数值一个是文本,需要先统一格式。

8.3 COUNTIF查出长数字身份证号时为什么误判

关于15位数字被截断的问题,我补充一个实战场景。比较两列身份证号时,用COUNTIF(A:A, A2)查重复,会得到大量“重复”结果,但实际号码不同。原因就是Excel的数值精度上限是15位,第16位起全部变成0。解决办法我在第2.3节提过,用COUNTIF(A:A, A2&"*")强制按文本处理。但更稳妥的做法是在读入数据时就把身份证列设置成文本格式,彻底绕开精度坑。

8.4 相似度阈值设多少合适

这是近似匹配最核心的参数。我从实际项目里总结的经验是:公司名和地址,阈值85分以上重点看,95分以上基本可以直接判定重复。人名相对敏感,80分以上就要仔细看,因为“陈静”和“陈婧”相似度可能超过90,但确实是两个人。产品名称、商品标题这类短文本,建议90分以上才判定重复,因为短文本任何一两个字符的差异,相似度波动都很大。

8.5 VBA宏跑到一半卡死怎么办

如果没有做屏幕刷新和自动计算关闭,处理3000行以上的数据,VBA宏很容易看起来像死机。除了前面提过的Application.ScreenUpdating = False,还可以在循环里定期配合DoEvents让系统响应一下,但最有效的还是先把疑似范围缩小。比如先用COUNTIF找出重复出现的候选行,再对候选行做编辑距离计算,这样能绕开大量的无意义比较。

8.6 Python读取Excel报错怎么办

pandas的read_excel依赖底层引擎。处理.xlsx文件需要openpyxl,处理较老的.xls文件需要xlrd。常见报错是安装命令没执行,或者安装了不兼容的xlrd版本。xlrd 2.0以上版本不再支持.xlsx,只支持.xls,所以如果你读.xlsx报错,安装openpyxl通常能解决。另外,如果文件路径包含中文,在Windows上偶尔会有编码问题,把路径改成英文或者用pathlib处理一下就好。

8.7 实用经验总结,能帮你少走弯路

这个需求拆开来看,核心就三件事:清洗归一化、去重判断、人工复核。工具选型上,小数据量(几千行)用Excel条件格式加COUNTIF足够;中等数据量(几千到一两万行)加一个VBA编辑距离脚本;大数据量(几万行以上)或者需要反复处理,直接上Python。我的经验是,不要一上来就写代码,先用Excel手动看一遍数据,理解脏数据的特征,再决定用哪套方案,这样反而更高效。

最后再分享一个小技巧。做任何去重之前,先把文件的创建时间和修改时间记录下来,再复制一份备份放好。我在处理一个几十万行的数据时,曾经因为误删了不应该删的行,靠备份恢复了半天的工作量。去重本身不难,难的是在保护数据完整性的前提下做去重。先把“家底”保住,再开始折腾算法和流程。这个习惯,我建议所有做数据处理的人都养成。

内容推荐

CSS Grid高级布局:从二维轨道到subgrid多维控制
CSS Grid · Flexbox · subgrid
CSS布局从传统的浮动、定位,到Flexbox的一维流动模型,再到Grid的二维轨道体系,每一次演进都在解决更复杂的对齐与自适应问题。Flexbox擅长处理单方向的内容排列,但在多行多列且需要严格对齐的场景下,常常力不从心。CSS Grid引入的行列坐标系,让开发者可以像操作表格一样规划布局,并通过fr单位、gap间距、隐式网格等机制实现内容驱动的自适应。更进一步,subgrid允许内层网格继承父级轨道,解决嵌套卡片中按钮跨卡片对齐的难题;配合auto-fill/auto-fit、dense流动及minmax(0,1fr)等技巧,能够构建真正多维、可控的响应式页面。无论是处理“css flex 布局子元素宽度自适应”的困惑,还是解决“css gap”带来的间距预期问题,Grid都提供了更系统的方案。掌握Grid,意味着从“摆放元素”升级为“规划轨道”。
Bulletin Chain:用临时存储破解区块链状态膨胀
状态膨胀 · 临时存储 · Bulletin Chain
状态膨胀源于链上数据默认永久保存的惯性,它让节点存储成本持续飙升、新节点同步时间拉长,并加剧验证者中心化。理解状态与历史的区别是治理膨胀的关键。临时存储方案Bulletin Chain通过验证者签名见证和生命周期管理,让时效性数据在活跃期后自动释放,兼顾链级可验证性与状态收缩。基于Polkadot生态与Substrate框架,该机制适用于预言机价格流、随机数结果、跨链通知等场景,为链上存储分层提供了一条新路径。
绿色AI实战:用Python优化机器学习项目能耗的完整指南
绿色AI · 能耗优化 · Python
在机器学习项目中,能耗往往被忽视,但训练和推理阶段的电力消耗直接影响成本和环境。本文从能耗测量入手,介绍如何使用Python监控GPU/CPU功耗,并系统阐述数据去重、主动学习、模型蒸馏、量化、Early Stopping、混合精度等低能耗优化策略。通过一个电商评论分类案例,展示了在不显著牺牲精度的前提下,将训练能耗降低86%的具体方法。无论你是独立开发者还是企业团队,都能从中获得可落地的绿色AI实践思路。
CSS圆角完全指南:从border-radius到跨端实战
border-radius · 圆角 · CSS
圆角并非简单的视觉装饰,而是影响用户情绪与界面层级的关键细节。在CSS中,border-radius通过抗锯齿算法在浏览器内完成渲染,其取值方式、椭圆角、百分比与像素的选择都直接影响视觉效果与性能。理解这些原理,开发者可以在网页设计中灵活运用圆角塑造界面气质,也能在处理android圆角按钮、混合应用WebView等跨端场景时规避兼容性问题。从视觉逻辑到工程落地,圆角的系统化管理已成为现代前端优化的基础能力,值得在项目初期就建立规范。
计算机网络八股面试:从TCP握手到HTTPS协议,把核心机制串成一条线
计算机网络 · TCP三次握手 · HTTPS
在技术面试与工程实践中,计算机网络始终是一道绕不开的基础关。从TCP/IP分层模型到数据封装流程,从TCP三次握手与四次挥手到滑动窗口与拥塞控制,再到HTTP/HTTPS的演进逻辑,这些看似零散的八股问题,本质上是检验开发者对协议机制与底层原理的理解深度。掌握分层设计的隔离思想,理解TCP可靠传输的边界条件,明白TLS握手中对称与非对称加密的配合,才能真正应对面试官的连环追问,并在线上故障排查、网络性能调优等真实场景中灵活运用。从输入URL到页面渲染,DNS解析、ARP寻址、NAT转换等环节共同构成完整的网络链路。与其死记结论,不如通过抓包验证和项目实践,把知识内化为工程本能。
产品经理手写HTML原型:从IDE到GitHub Pages公网部署全流程
HTML原型 · 产品经理 · GitHub Pages
静态网页是Web开发最基础的形态,而版本控制与自动化部署则是现代工程实践的基石。HTML原型作为最接近真实产品的方案表达方式,正被越来越多产品经理用于替代传统线框图。其原理在于通过HTML/CSS/JS三层分离构建可交互页面,并借助Git管理迭代、利用GitHub Pages实现零成本公网部署。这一工作流不仅降低了研发与产品间的理解成本,也让需求评审从静态文档转向可点击的真实页面。在B端后台、SaaS产品设计等场景中,产品经理亲手搭建原型可显著提升协作效率与方案说服力。整个流程覆盖IDE选型、本地预览、Git操作到一键部署的完整链路,帮助非技术背景读者快速掌握这套高效工具链。
Kubernetes 生产排障实战:从 Pod 崩溃到 etcd 性能调优
Kubernetes · Pod · CrashLoopBackOff
Kubernetes 作为容器编排的核心平台,其稳定性直接关系到业务连续性。在复杂的分布式环境中,故障往往并非单一原因所致,而是涉及 Pod 生命周期、节点资源、网络插件乃至控制面存储等多个层面。理解容器调度与运行机制,掌握系统化的排障思路,是运维工程师的核心能力。从 CrashLoopBackOff、OOMKilled 等常见 Pod 异常,到 Node 资源压力、CNI 网络抖动、DNS 解析失败,再到 etcd 磁盘延迟与请求超时,每一类问题都有其典型特征与排查路径。通过现象驱动的命令组合、指标分析和根因定位,能够有效缩短故障恢复时间。本文结合生产环境中的真实案例,系统梳理从 Pod 崩溃到 etcd 性能调优的完整排查链路,提供可落地的操作命令与参数调优建议,帮助工程师在面对集群告警时快速建立清晰的处置策略。
过流保护与能耗统计一体化:配电监控模块设计与工程实践
过流保护 · 能耗统计 · 配电监控
在工业配电与电气自动化领域,保障供电安全与实现精细化能耗管理是两大核心需求。传统的电力仪表只能观测数据,而断路器无法记录过程,由此催生了集过流保护与电能计量于一体的智能监控模块。这类模块通常采用MCU+专用计量芯片+模拟比较器架构:计量芯片负责准确的电压电流采样与电能累计,模拟比较器实现微秒级短路保护,MCU则承担反时限过载算法与Modbus-RTU通信。其技术价值在于将原本分离的测量、保护、记录统一到一个紧凑设备中,并通过RS485总线接入上位机,为配电柜数字化提供基础数据。典型应用场景包括工厂配电柜改造、产线设备能耗监测、智能运维平台等。围绕ACN配电监控模块,详细解析过流保护电路参数、能耗统计实现与工业现场适配要点,为电气工程师提供可落地的参考。
P2P0子节点不存在:PCIe枚举与ACPI修复排查指南
PCIe · ACPI · 设备树
在操作系统与硬件交互中,设备枚举是发现PCIe设备的关键环节。固件通过ACPI表(如DSDT)描述设备拓扑,而链路训练则决定设备是否在总线上可见。当PCIe链路训练失败或ACPI表不完整,系统就会出现“子节点不存在”甚至设备消失的报错。理解设备树与枚举机制,能帮助工程师快速区分物理链路、固件配置与ACPI描述三类根因,避免盲目更换硬件。从BIOS自检报错到系统日志,再到lspci与iasl工具验证,这类排查方法广泛应用于PC、服务器与嵌入式平台。本文基于真实案例,聚焦P2P0、S5F0等报错信息,完整梳理PCIe/ACPI枚举问题的定位与分析流程。
缺陷根因分析怎么做?用5 Whys和鱼骨图根治反复出现的Bug
缺陷根因分析 · Root Cause Analysis · RCA
在软件开发和测试中,缺陷重复出现往往是因为只修复了表面症状,而没有触及根本原因。根因分析是一种系统性的问题解决方法,通过区分症状、直接原因和根本原因,利用5 Whys、鱼骨图等经典工具逐层深挖,定位让问题反复发生的系统性漏洞。其核心价值不仅在于修复当前缺陷,更在于制定可落地的纠正措施,从流程、规范、测试覆盖等层面建立长效机制,防止同类问题再次发生。对于测试、研发、质量保障人员而言,掌握一套科学的根因分析流程,能够有效减少线上故障的重复出现,提升整体软件质量,让每一次缺陷处理都成为团队能力的积累。
AI为何够格比肩工业革命:从生产方式变革到Agent工程落地
AI革命 · 工业革命 · 大模型
每一次技术革命,本质上都是对生产方式底层要素的重塑。蒸汽机替代了动力,而大模型第一次让“认知”与“判断”可以被低成本外包,这正是AI被称为通用目的技术的核心依据。从AI编程中“写代码”到“审代码”的转变,到AI Agent从问答走向闭环执行,技术价值正从工具效率跃迁为生产力单元的重构。在短视频、营销、客服等标准化场景中,AI已跑通降本增效的真实路径,但工程可控性、成本账与安全合规仍是落地关键。本文从开发与产品实践视角,拆解AI变革的底层逻辑,探讨普通团队如何以最小成本验证场景,将AI能力沉淀为长期资产。
Apache AGE实测:PostgreSQL图扩展的能力边界与选型建议
Apache AGE · PostgreSQL · 图数据库
图数据库以灵活的节点和关系模型著称,在组织架构、权限链路、知识图谱等场景中表现突出。PostgreSQL作为通用关系型数据库,通过扩展机制可融入图查询能力,Apache AGE即是其中代表——它将openCypher查询解析、改写为SQL执行,复用了PG的存储与事务机制。这种方式避免了引入独立图数据库的运维开销,降低了图技术门槛,适合数据量在百万级节点内、以局部遍历为主的企业内部关系网络分析。然而,AGE并非完整的Cypher实现,复杂图算法、深链路遍历及高并发场景下,其性能与生态成熟度均逊于Neo4j等专业图数据库。基于实际项目部署与测试经验,梳理Apache AGE的安装要点、性能瓶颈、功能边界及选型决策,可帮助技术团队客观评估“万物皆可PostgreSQL”的适用边界。
狱内罪犯危险性评估系统:SpringBoot+Vue前后端分离毕设实战解析
SpringBoot · Vue · 前后端分离
在Java Web开发领域,SpringBoot与Vue的组合已成为构建前后端分离应用的主流技术方案。SpringBoot简化了后端服务搭建,Vue提供了高效的组件化前端开发体验,二者通过RESTful API交互,并借助JWT实现无状态认证。这种架构广泛应用于各类管理系统,如监狱风险评估、企业后台等。本文以狱内罪犯危险性评估系统为例,详细讲解从数据库设计、后端业务逻辑、前端页面到部署排错的全流程,展示如何将业务需求转化为可运行的工程化项目,为毕设或实战提供参考。
InnoDB行级锁原理详解:从索引记录锁到间隙锁与死锁
InnoDB · 行级锁 · 索引记录锁
数据库并发控制中,行级锁是最常被提及却又最难理解的机制之一。在MySQL InnoDB存储引擎中,行级锁并非直接锁定数据行,而是锁定索引记录及索引区间。理解这一点是掌握Record Lock、Gap Lock、Next-Key Lock等概念的基础。索引的存在与否、隔离级别的设置以及查询条件的具体形态,共同决定了锁的粒度和范围。无索引时,锁会退化为全表扫描加锁;有唯一索引时则可精确锁定单行。间隙锁与临键锁用于防止幻读,但同时也可能造成锁竞争和死锁。通过performance_schema可实时观察锁结构,结合死锁日志与事务等待链分析,能够快速定位并解决锁问题。合理设计索引、统一事务访问顺序、控制事务长度,是降低锁争用与死锁风险的关键工程实践。
AutoDL GPU云实例实战指南:从选卡到环境配置的完整流程
AutoDL · GPU租赁 · 云GPU
在深度学习中,GPU算力是推动模型迭代的核心资源。传统自购显卡或包月云主机成本高、灵活性差,而按量计费的GPU租赁服务正成为个人开发者和小型团队的主流选择。理解GPU虚拟化、容器镜像和CUDA生态的运作原理,是高效使用这类平台的关键。PyTorch作为主流深度学习框架,其环境配置依赖驱动、CUDA Toolkit与运行时库的精确匹配,而AutoDL等平台通过预置框架镜像简化了这一过程。本文从算力成本分析切入,系统讲解如何选择合适的GPU实例、配置镜像与存储、打通SSH与远程开发工具链,并深入剖析环境持久化、数据迁移和异常恢复的底层机制。无论你是初次接触云GPU,还是希望优化现有实验流程,这套从零到一的实战指南都能帮助你以最低成本稳定跑通深度学习训练任务。
D3DCompiler_47.dll丢失深度解析:从原理到安全修复实战指南
D3DCompiler_47.dll · DLL缺失 · DirectX修复
动态链接库(DLL)是Windows系统运行各类软件与游戏的基础组件,一旦缺失,程序启动时就会报错。D3DCompiler_47.dll正是负责着色器编译的关键文件,游戏和图形应用依赖它来将Shader代码实时翻译为显卡指令,其丢失会导致DirectX相关应用无法运行。许多人遇到此问题会去第三方下载站获取单个DLL,这往往带来恶意代码和系统二次损坏的风险。正确的修复思路是恢复完整的DirectX运行时环境,可通过微软官方End-User Runtime、DirectX修复工具或系统文件检查器(sfc /scannow)等方案安全补齐。在工程实践中,还需注意32位与64位文件的区分、游戏目录内同名DLL的冲突,以及安装常用运行库如Visual C++和.NET,才能从根源上避免DLL缺失问题再次发生。
链式队列从零实现:C语言数据结构与指针操作详解
链式队列 · C语言 · 数据结构
数据结构中,队列是遵循先进先出(FIFO)原则的线性表,常用于解决任务排队与缓冲问题。理解队列的核心在于队头与队尾的指针维护,而链式队列通过动态分配结点,避免了顺序队列的“假溢出”与扩容开销。在C语言中实现链式队列,需要把握结点结构体、队头队尾指针以及入队出队的指针更新顺序,同时注意内存释放。这种基础结构广泛用于线程池的任务排队、消息队列的生产消费模型,甚至Redis的List操作中。掌握链式队列的写法与调试技巧,是深入学习更复杂数据结构的关键一步。
MATLAB实战:VS-Transformer多变量时间序列预测
MATLAB · Transformer · 时间序列预测
多变量时间序列预测在工业与科研场景中需求广泛,但传统方法难以捕捉变量间的复杂耦合与时序依赖。Transformer架构凭借强大的特征提取能力成为时序预测的新趋势,而通道独立思路的引入进一步提升了长序列预测的稳定性。VS-Transformer作为一种面向多变量预测的改进结构,通过为每个变量构建独立的编码路径,有效减少变量间噪声干扰,提升模型鲁棒性。本文从多变量预测的核心矛盾出发,阐述VS结构的设计原理与技术价值,并基于MATLAB R2023b环境,完整展示了数据预处理、Transformer编码器构建、自定义训练循环及GUI交互界面的实现流程。该方法规避了变量混叠导致的伪相关,适用于电力负荷、工业传感监测等场景,为不依赖Python环境的研究与工程人员提供了可复现的解决方案。
vscode + xdebug + phpstudy 本地PHP断点调试环境配置完全指南
PHP · Xdebug · VSCode
在Web开发中,断点调试是比日志输出更精准的错误定位手段。其核心原理是让运行中的程序在指定行暂停,并冻结当前上下文供开发者检视,这也是PHP调试中Xdebug扩展的核心价值。Xdebug作为PHP的Zend扩展,通过监听端口与IDE通信,实现变量查看、单步执行与调用栈追踪。针对本地PHP开发环境,合理配置phpstudy中的php.ini参数及VSCode的launch.json文件,即可构建一套完整的交互式PHP调试工具链。无论是排查复杂的控制器逻辑还是执行CLI脚本,断点调试都能极大提升问题定位效率。本文从零深入讲解phpstudy侧Xdebug扩展安装、VSCode侧PHP Debug插件配置,以及真实踩坑案例,帮助PHP开发者快速落地实用的本地调试方案。
GameFramework任务池源码解析:从任务调度到零GC的工程实践
GameFramework · 任务池 · Task Pool
在Unity游戏开发中,异步任务管理是资源加载、网络请求等高频操作的基石。任务池(Task Pool)作为常见的对象池与调度框架,通过复用任务对象、统一任务生命周期,有效降低运行时GC分配。其核心原理是将任务定义与执行代理分离,由调度中枢按优先级排队,并由空闲代理逐帧领取执行。这种设计不仅提升了代码复用性,还能避免大量对象创建带来的性能抖动。在GameFramework中,任务池贯穿资源模块、Web请求等场景,是理解其异步架构的关键。本文结合源码拆解任务生成、调度、回收的完整链路,并手写下载任务池,帮助开发者掌握这一高效调度机制。
已经到底了哦
精选内容
热门内容
最新内容
随机森林嵌入式特征选择:原理、实战与避坑指南
特征工程是决定机器学习模型上限的关键环节,而特征选择则是其中必不可少的一步。面对高维数据带来的维度灾难和过拟合风险,如何高效筛选有效特征成为数据建模的核心挑战。过滤式与包裹式方法各有局限,嵌入式特征选择通过在模型训练过程中评估特征重要性,实现了效率与效果的平衡。随机森林作为集成学习代表,天然支持特征重要性度量,可通过基于不纯度下降(MDI)和排列精度下降(MDA)两种机制为特征排序,直接服务于特征降维与模型优化。借助scikit-learn的SelectFromModel与RFECV工具,实践者能将特征工程从经验驱动转向流程驱动的标准化操作,在风控、供应链预测等工业场景中显著提升模型训练速度与可解释性。本文系统地介绍了随机森林特征重要性的计算原理、完整代码流程与工程踩坑经验,帮助数据科学从业者掌握一种稳健的嵌入式特征选择方案。
Linux用户与组管理:从配置文件到权限实战全攻略
Linux系统运维中,用户与组的管理是权限控制与安全隔离的基础。理解UID、GID机制以及/etc/passwd、/etc/shadow等核心配置文件,是掌握账户体系的关键。通过合理的组策略和sudo授权,既能实现批量权限分配,又能精细管控操作边界。无论是服务账号创建、临时账号过期设置,还是协作目录下的SetGID位配置,都离不开对权限模型和命令细节的深入理解。本文结合典型场景与排障案例,梳理从用户创建到权限配置的完整链路,帮助运维新手快速搭建安全可控的多用户环境,同时也为处理文件属主异常、sudo失效等常见问题提供排查思路。
D3DCompiler_47.dll缺失如何修复?原理、风险与安全修复流程
在Windows系统中运行游戏或图形软件时,常会遇到“计算机中丢失D3DCompiler_47.dll”的错误提示,这通常与DirectX组件不完整或系统运行库缺失有关。D3DCompiler_47.dll是DirectX生态中负责编译HLSL着色器的关键动态链接库,现代GPU渲染需要它将着色器代码翻译为硬件可执行指令。一旦文件缺失或损坏,游戏、渲染器及视频工具都会启动失败。常见原因包括杀毒软件误隔离、安装不完整、系统更新异常或优化工具误删。修复时不应从第三方下载站随意获取dll,而应优先通过微软官方DirectX End-User Runtime、系统SFC/DISM命令、可信来源复制等方案按优先级操作。掌握从系统目录检查、版本签名验证到软件目录补全的完整流程,可安全解决绝大多数dll缺失问题,避免系统进一步受损。
微信小程序个性化漫画推荐系统:从协同过滤到Spring Boot实践
在移动互联网时代,推荐系统已成为连接内容与用户的关键技术,它通过分析用户行为与偏好,实现从“人找内容”到“内容找人”的转变。协同过滤作为最经典的推荐算法之一,其原理基于用户或物品的相似性计算,能够在海量数据中挖掘潜在兴趣,被广泛应用于电商、视频、阅读等场景。一个完整的推荐系统不仅包含算法模型,还涉及用户画像构建、行为数据建模、后端服务设计以及前端交互实现。结合微信小程序这一轻量级应用容器,开发者可以快速搭建一个覆盖前端、后端与算法的全栈项目。本文以个性化漫画推荐为切入点,详细介绍了如何利用协同过滤、用户标签体系与兴趣衰减策略,配合Spring Boot、MySQL和Redis构建高可用的推荐服务,并剖析了小程序端页面架构、登录鉴权以及Nginx部署落地的完整流程,为开发者提供了一套从理论到工程实践的参考路径。
BepInEx实战:从零开始掌握Unity游戏Mod制作与Harmony补丁
游戏修改是玩家探索玩法边界的重要方式,而Unity引擎凭借其跨平台和易用性,成为众多独立游戏与商业游戏的首选。要在Unity游戏中实现功能扩展,Mod框架是不可或缺的基础设施。BepInEx作为当前社区最成熟的Unity Mod运行框架,通过预加载机制在游戏启动时挂载插件,让开发者无需修改游戏原始文件即可注入自定义逻辑。结合Harmony补丁库,开发者可以精准拦截并修改游戏方法,实现从数值调整到玩法重构的多种效果。无论是Mono还是IL2CPP后端,BepInEx都提供了相应的解决方案。本文围绕环境准备、框架安装、首个Mod编写和常见问题排查,系统梳理了Unity Mod开发的完整流程,为希望动手定制游戏体验的开发者提供可落地的技术参考。
Honey个人仪表盘Docker部署实战:聚合天气RSS与系统负载
个人仪表盘是自托管场景中的轻量信息聚合工具,它把天气、RSS订阅、系统负载等高频信息统一呈现到一个页面,避免在多个标签页间来回切换。其核心理念是用一个后端进程抓取数据并以JSON形式提供给前端渲染,不依赖数据库或中间件,资源占用极低。容器化部署则能有效隔离环境、简化升级回滚,并将配置数据持久化到宿主机目录,这也是NAS和家庭服务器场景下的首选方式。通过理解配置文件中的端口、更新间隔、API Key等关键字段,再借助docker run或docker-compose命令即可快速搭建。这类方案特别适合已有NAS或Linux服务器、希望以低成本获得统一信息入口的用户。本文以Honey为例,完整演示了从环境准备、配置拆解到故障排查的实战流程,帮助读者快速上手一套可长期运行的自托管仪表盘。
Java竞赛字符串操作模板与底层原理全解析
字符串是编程中最基础也最常被忽视的数据结构之一,在Java中尤其如此。理解String的不可变性、常量池机制以及JDK 9后底层byte[]存储的演变,是掌握字符串性能与安全性的关键。从字符遍历、拼接、分割到正则匹配,每一处实现细节都直接影响程序在数据密集型场景下的表现。在算法竞赛与后端面试中,字符串哈希、KMP模式匹配、Trie前缀树、Manacher回文算法等核心模板,更是解决子串查询、统计与回文问题的利器。本文结合实战经验,系统梳理Java字符串的底层原理、高频操作模板与常见踩坑记录,帮助读者从理论到代码层面全面提升字符串处理能力。
提示词工程实战:从过度架构到最小可靠AI应用
在大模型应用落地过程中,许多团队一上来就追求微服务、RAG、Agent编排等标准AI架构,却忽略了一个核心事实:真正决定业务效果的往往不是外围工程,而是提示词本身。提示词工程本质上是将需求规格说明书转化为自然语言接口,它需要清晰的任务定义、显性的业务规则、结构化的输出协议以及覆盖关键类型的示例。只有当提示词具备工程化能力,配合薄壳式的代码骨架,才能实现可维护、可验证的AI应用。本文以工单自动分类与摘要生成实战为例,分享从过度设计回归最小可靠系统的经验,涵盖提示词版本管理、模型选型、参数调优、重试与解析兜底等工程实践,为AI应用开发者提供一条从“能用”到“好用”的迭代路径。
OpenStack新计算节点上线全流程:从检查到性能验证
在云计算基础设施的日常运维中,OpenStack作为开源IaaS平台,其计算节点的扩容与纳管是工程实践中的高频场景。节点加入集群并非简单的服务安装,而是涉及系统版本、网络规划、主机名解析、时间同步等多维度的基础共识建立。Nova作为计算服务核心,通过cell v2机制完成节点发现与映射,才能让调度器感知新资源。在此基础上,实例创建、网络连通性、热迁移等基础功能验证,以及sysbench、fio、iperf3等性能基准测试,构成了衡量节点健康度的关键链路。面对节点状态异常、调度失败、网络抖动等典型问题,系统化的排查方法能有效缩短故障恢复时间。本文从OpenStack计算节点接入的底层原理出发,结合真实环境中的操作经验与踩坑记录,为云平台管理员提供一套从检查清单到性能验证的完整实践路径,帮助新节点平稳融入生产集群,支撑业务高效运行。
007商务平台item_get接口对接实战:从签名到商品详情解析
在电商开放平台体系中,API接口对接是企业实现商品数据同步、价格监控与供应链选品的基础能力。接口调用的核心在于理解签名算法与参数构造规则,通过App Key与App Secret生成合法请求,确保数据交互的安全性与稳定性。本文从通用API对接原理出发,围绕商品详情查询场景,系统讲解item_get接口的鉴权流程、公共参数规范、返回字段结构以及高频错误排查思路,并通过Java代码示例演示从签名生成到JSON解析的完整链路。该接口广泛应用于多平台商品聚合、库存同步、竞品分析等工程实践,掌握其对接方法可有效应对页面爬取方案在维护成本、反爬策略与合规风险上的痛点,为开发者构建可靠的数据底座提供参考。
已经到底了哦