1. hashid到底是什么:从功能到安装
1.1 一条命令解决哈希认不出的尴尬
我最早遇到hashid这个工具,是在一次内网安全审计的半路上。当时从测试系统里导出到一批用户密码摘要,第一眼看上去长度是32位十六进制,我顺手按MD5去跑字典,结果跑了一天颗粒无收。后来同事看了一眼说,这串可能是NTLM变种,换了个模式几分钟就出结果了。那之后我才意识到,哈希识别这个看似不起眼的环节,其实在整个密码审计链路里卡住了太多人。
hashid就是一个专门解决“这串哈希到底是什么算法”的小工具。它的全称是Hash Identifier,最初由psychonaut开发,后来在Kali等渗透测试发行版里被收录并沿用至今。你只需要把一串哈希字符串丢给它,它会基于字符串本身的格式特征,输出可能匹配的哈希算法列表,并给出对应的John the Ripper格式编号和Hashcat模式编号。换句话说,它不负责破解,只负责告诉你“该往哪个方向下手”。
这个工具的适用人群很明确:安全测试工程师、CTF玩家、做密码学取证的分析人员,以及偶尔需要处理用户密码字段的开发同学。对刚入行的人来说,它能帮你少走很多弯路;对老手来说,它是一个标准的“快速分流器”,能显著减少人工判断哈希类型的时间。我在多个项目里实测下来的感受是:它不依赖网络、不需要数据库同步、也不用配置任何环境变量,一条命令搞定,非常适合嵌到自动化处理脚本里。
1.2 三种安装方式:Kali自带、pip安装、源码编译
先说我平时最常用的安装路径。如果你用的是Kali这种集成型渗透测试发行版,hashid一般已经预装好了,直接敲hashid看有没有输出就知道。如果没有,或者你用的是其它Linux发行版,那有三种常见方式可以装上。
第一种是系统包管理器安装。在Debian系里执行:
bash复制sudo apt install hashid
这种方式的优势是会和系统依赖一起管理,升级方便。缺点是不同发行版仓库里的hashid版本可能偏旧,功能上会有细微差异。比如老版本对某些新哈希算法的支持就不够全。
第二种是我个人最推荐的pip安装方式。hashid在PyPI上发布了Python包,源仓是python-hashid,装起来非常干净:
bash复制pip install hashid
装完直接输入hashid命令就能用。这种方式的好处是随时能拿到最新版,而且可以通过pip show hashid查看具体的安装位置和版本号,方便排查问题。需要注意的一点是,如果你用的是系统自带的pip,可能需要加--user参数避免破坏系统Python环境;在macOS或者Windows的WSL环境里,建议先建一个虚拟环境再装,省得后续依赖冲突。
第三种是源码编译。如果你想自己改逻辑,或者需要在离线环境部署,可以直接从GitHub拉取源码:
bash复制git clone https://github.com/psypanda/hashID.git
cd hashID
python setup.py install
源码方式最大的价值是透明——你可以直接翻到hashid.py或者lib/目录下看它的匹配规则表,了解它是怎么判断哈希类型的。这一点对后面我们讲“识别原理”很有帮助,因为工具也会有误判,读得懂源码你才能真正用它。
我在实际项目里建议的路径是:Kali里用系统自带,普通Linux和macOS用pip,Windows上如果不想折腾就直接在WSL里用pip。三种方式熟练一种就够了,重点是把精力放在用法和判断逻辑上。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 基础用法与输出解读
2.1 最简单的用法与输出字段
hashid的基本用法非常直白,就是把哈希字符串作为参数传进去:
bash复制hashid 'e10adc3949ba59abbe56e057f20f883e'
输出大致长这样:
code复制Analyzing 'e10adc3949ba59abbe56e057f20f883e'
[+] MD5
[+] MD4
[+] MD2
[+] Double MD5
[+] LM
[+] RIPEMD-128
[+] Haval-128
[+] Tiger-128
[+] Skein-256(128)
[+] Skein-512(128)
[+] ...(略)
这里的“Analyzing”是待识别哈希字符串,“[+]”后面的每一行都是它认为可能匹配的算法名称。可以看到,32位十六进制这组特征能匹配到的算法非常多,不只是MD5。这种情况下,hashid会按“最可能的排在前面”的方式输出,但需要注意,它给出的顺序只是基于特征判断,不是绝对结论。
当你拿到一个比较冷门的哈希时,输出里可能只有一两个候选。比如bcrypt前缀的$2a$基本可以直接锁定到Blowfish类,而这种“高置信度”识别最能体现hashid的价值。
除了单条输入,hashid也支持从管道读取批量输入。举个例子,如果你有一个存了很多哈希的文件hashes.txt,每行一个,可以这样批量识别:
bash复制cat hashes.txt | hashid
它会逐行分析,并在每条哈希下方列出候选算法。这个批量能力在写自动化脚本时非常实用,我们后面会专门讲。
2.2 常用参数详解:-m、-j、-e
hashid的常用参数并不多,但每一个都有明确的用途。我按使用频率排个序。
-m参数的作用是让输出附带John the Ripper的格式编号。John是老牌密码破解工具,它的--format=参数需要知道具体格式名,但不同版本的John对格式名要求很严格。使用-m后,hashid会直接输出类似[+] MD5 (JtR: raw-md5)这样的提示,省得你再去查John的格式表。
-j参数对应的是Hashcat的模式编号。Hashcat用户更多一些,因为它的GPU加速能力很强。使用-j后输出会变成[+] MD5 (Hashcat: 0),这里的数字就是hashcat的-m 0参数。这个功能非常实用,等于直接把hashid和hashcat串成了一条流水线。
-e参数表示列出所有可能的算法,而不是只显示置信度最高的那部分。默认情况下,hashid只输出匹配特征最明确的前几个,加了-e之后它会穷举所有命中的算法。如果你在做逆向分析或者CTF,有些线索引出来之后发现有好几个可能,这时候用-e能帮你看到更多候选方向。
还有一个--help参数配合-m -j -e,三条命令就能覆盖绝大多数场景。我自己的习惯是固定使用hashid -m -j来同时得到John和Hashcat的编号,省得来回翻文档。要是识别结果歧义太大,再补一个-e看看全量情况。
2.3 快速上手:把输出喂给Hashcat
这里分享一个我常用的联动姿势。拿到一串哈希后,先用-m -j识别,再用管道命令把Hashcat模式号提取出来,最后直接进入破解流程。命令大概是这个样子:
bash复制hashid -m -j '5f4dcc3b5aa765d61d8327deb882cf99'
输出中会包含(Hashcat: 0)这样的信息,此时可以手工抄下编号跑hashcat。如果想完全自动化,可以用grep和awk提取:
bash复制HASH='5f4dcc3b5aa765d61d8327deb882cf99'
MODE=$(hashid -j "$HASH" | grep -oP 'Hashcat: \K[0-9]+' | head -n 1)
hashcat -m "$MODE" -a 0 "$HASH" rockyou.txt
这个脚本的思路是:先用hashid把哈希类型识别出来,再从中提取最可能的Hashcat模式号,最后交给hashcat跑字典攻击。我在真实项目中用这个方法省去了大量人工查格式的时间,尤其是面对一批格式混杂的哈希时,效果特别明显。
需要提醒的是:自动提取模式号时,head -n 1取的是第一个匹配项。如果哈希特征本身有歧义,比如32位十六进制同时能匹配MD5和NTLM,自动取第一个可能不是最优选择。针对这种情况,我会在脚本里加一层人工确认逻辑,把前三个候选模式都列出来。这个细节我们在“常见问题”章节再展开。
3. 识别原理与判断逻辑
3.1 按格式特征做特征匹配
hashid能识别哈希类型,核心原理并不是去“反解”哈希,而是做特征匹配。它内置了一张规则表,每条规则包含两部分:一个正则表达式,以及这个表达式对应的哈希算法列表。
举个例子,32位的十六进制字符串对应正则^[a-f0-9]{32}$,而符合这组特征的可能算法包括MD5、MD4、NTLM、LM、RIPEMD-128等。hashid会把输入的哈希字符串依次和所有正则表达式做比对,凡是匹配成功的,就把对应算法加入候选列表。
除了纯字符长度和字符集的匹配,hashid还专门处理了一些带标识前缀的哈希。例如:
- 以
$P$或$H$开头,通常是WordPress的phpass密码哈希 - 以
$2a$、$2b$、$2y$开头,是bcrypt - 以
$6$开头,是SHA-512 crypt - 以
$1$开头,是MD5 crypt
这些前缀是哈希算法在生成密文时写入的“类型标签”,属于各算法约定俗成的规范。hashid通过识别这些标签,可以给出高置信度的判断。这也是为什么带前缀的哈希经常能一把识别,而不带前缀的纯十六进制哈希则会有很多歧义。
了解这个原理之后,你就能明白hashid的一个能力边界:它只能基于字符串的外部形态做判断,无法验证“这个哈希到底是不是某个算法的计算结果”。换句话说,它给的是推测性的候选列表,不是绝对答案。
3.2 为什么不只是看长度
很多人刚开始判断哈希类型时,习惯只看长度,比如“32位就是MD5,40位就是SHA1,64位就是SHA256”。这个经验在简单场景下能应付,但一旦遇到真实数据就漏洞百出。
问题出在三个方面。第一,哈希算法的输出长度并不唯一。MD5是128位即32个十六进制字符,MD4、NTLM、LM等算法同样是128位输出。单看长度,你根本无法区分它们。第二,很多算法支持多种输出长度。以SHA-256为例,它还有SHA-224这种截断版本,BLAKE2也支持从1字节到64字节的任意输出长度,遇到这类算法根本没法用固定长度去套。第三,哈希可能经过多次处理或加盐变形。比如Double MD5是对MD5结果再次做MD5,输出仍然是32位,但破解方式完全不同;加盐后的MD5虽然识别特征没变,但实际验证和破解方式都变了。
所以在实际使用时,我一般不把长度当作唯一的判断依据,而是结合三组特征:字符集和长度是基础,前缀后缀是强信号,有没有$分隔符、有没有Base64字符集等细节是辅助判断。hashid在内部就做了这层综合,这一点是它比人工看长度更靠谱的原因。
3.3 常见哈希家族的特征速查
为了方便日常使用,我整理了一张常见哈希的特征表,你可以直接收藏备用:
| 哈希算法 | 典型长度/格式 | 特征标识 | 典型示例 |
|---|---|---|---|
| MD5 | 32位十六进制 | 无前缀 | e10adc3949ba59abbe56e057f20f883e |
| SHA1 | 40位十六进制 | 无前缀 | da39a3ee5e6b4b0d3255bfef95601890afd80709 |
| SHA256 | 64位十六进制 | 无前缀 | 2c26b46b68ffc68ff99b453c1d30413413422d706483bfa0f98a5e886266e7ae |
| NTLM | 32位十六进制 | 无前缀 | b4b9b02e6f09a9bd760f388b67351e2b |
| bcrypt | 60字符左右 | $2a$/$2b$/$2y$ 开头 |
$2a$10$N9qo8uLOickgx2ZMRZoMyeIjZAgcfl7p92ldGxad68LJZdL17lhWy |
| SHA512 crypt | 106字符左右 | $6$ 开头 |
$6$rounds=10000$... |
| MD5 crypt | 34字符左右 | $1$ 开头 |
$1$abcdefgh$1234567890abcdefghijklmnopqrstu |
| WordPress phpass | 34字符左右 | $P$ 或 $H$ 开头 |
$P$Bxyz... |
| Argon2 | 长字符串 | $argon2id$ 开头 |
$argon2id$v=19$m=65536,t=2,p=1$... |
这张表看起来简单,但实际判断时要特别注意:同样是32位十六进制,MD5、NTLM、LM的区别靠长度看不出来,只能靠上下文推断或直接尝试。hashid能帮你把候选算法列出来,但“最终选哪个”,往往还需要结合数据来源和破解结果来确认。
4. 实操案例:从拿到哈希到破解思路落地
4.1 场景一:内部系统密码安全审计
有一次项目上需要对一个老系统的用户表做密码强度评估,导出的文件里存的是用户密码哈希。几千行数据里有长有短,第一反应是不能全按一个算法去跑。我用hashid批量识别了一遍,命令很简单:
bash复制cat password_hashes.txt | hashid -j > hashid_output.txt
然后按照输出里的Hashcat模式号分组统计,结果发现大部分是WordPress的phpass哈希,配合一小部分SHA512 crypt,还有几条是明文Base64,几乎可以确认是系统不同时期改版留下的历史数据。
这种“按模式号分组”的思路能快速摸清数据分布,后面的破解就能对症下药。我先把比例最高的phpass哈希交给hashcat用-m 400跑,再把SHA512 crypt用-m 1800跑。整个过程省掉了一个一个试格式的功夫,从拿到数据到出结果只花了一个下午。
这个场景里hashid解决的核心问题是“批量数据的快速分流”。如果你管理过类似的存量系统,就知道数据源历史越久,格式越五花八门,这时候人工分辨的效率远不如脚本化识别。
4.2 场景二:CTF题目里的哈希识别
CTF比赛里经常会遇到“给你一段密文,让你找原文”的题目。有一次在Web方向遇到一个登录功能,后端返回的密文是5f4dcc3b5aa765d61d8327deb882cf99。我第一时间用hashid识别:
bash复制hashid -m -j '5f4dcc3b5aa765d61d8327deb882cf99'
输出显示的可能匹配有很多,最显眼的是MD5,对应的Hashcat模式是0。我用hashcat的-m 0加字典模式,直接用rockyou字典就解出了明文。如果那次没识别出来,而是盲目用别的模式跑,很可能会在SHA1、NTLM这些模式里反复试错,浪费大量时间。
CTF和真实审计的区别在于,题目往往有比较明确的暗示——比如口误留在源码注释里,或者固定的提交格式。hashid在CTF里的作用更像“第一道安检”,先把技术方向定了,后面再根据题目的其他线索缩小范围。我在比赛中还试过用-e参数列出所有候选算法,再结合题目给出的信息量判断最可能的一个。
4.3 场景三:文件摘要和字符串用途确认
除了密码哈希,hashid还能用来识别一些非“密码哈希”场景的字符串。比如开发时碰到一个配置文件里写着一串疑似密钥的字符串,想确认它是什么算法生成的,就可以先hashid一把看看候选算法。再比如逆向分析时从内存里导出一串十六进制数据,初步判断它可能是个摘要值,这时候hashid能帮你快速定位可能的算法范围。
这种场景下,hashid的输出不是最终答案,但它能给出一个“可能的算法候选池”,给后续分析指明方向。我在做二进制日志分析时,就经常用它来过滤掉那些一看就是普通MD5或SHA1的字符串,把精力聚焦在更有分析价值的自定义哈希上。
5. 常见问题与踩坑记录
5.1 误判与歧义:同一哈希命中多个算法
hashid最典型的“坑”就是误判和歧义。前面已经说过,32位十六进制能匹配MD5、NTLM、MD4等一堆算法。如果只看输出列表,你很容易被带偏,选了“看起来像”的算法,结果破解失败。
我通常的应对策略是:不轻信单一候选,尤其是纯十六进制哈希。拿到结果后如果候选超过三个,我不急着选第一个,而是先看上下文——这段哈希来自什么系统、什么字段、谁生成的。比如企业AD环境的用户密码哈希,大概率是NTLM;老论坛数据库里的32位哈希,大概率是MD5。上下文信息能帮助你从hashid的候选列表里做二次筛选。
另一个验证方法是拿一个已知明文做对照测试。比如你怀疑某串是MD5,那就对空字符串或常见弱密码做一次MD5,看看输出格式是不是同一长度同一风格,再决定要不要投入破解资源。这个方法虽然土,但在关键时刻非常管用。
5.2 输出格式不兼容怎么处理
hashid的-m和-j分别输出John和Hashcat的格式编号,但这两个编号不是一一对应关系。有些哈希算法在John里叫raw-md5,在Hashcat里叫0,看起来还好;但有些算法的命名差异很大,直接套用可能出错,尤其是冷门算法。
我处理这类问题的原则是:-j输出优先用于Hashcat,-m输出优先用于John,不要混用。如果你在Hashcat里跑-m对应的John模式,基本跑不出结果。另外,如果你用的是Hashcat老版本,某些模式编号可能不存在,需要先hashcat --help | grep <算法名>确认模式可用。
还有一个小坑是hashid输出中“JtR”和“Hashcat”的出现是有条件的。并不是每个候选算法都同时支持两种工具,有的算法只有John格式,有的只有Hashcat格式。看到输出里只有一边有编号时,不要惊讶,这是正常现象。
5.3 自动化脚本的注意事项
批量识别时,最怕的是脚本把第一行候选当成唯一答案。我自己的做法是把hashid输出解析成结构化数据,再结合结果做二次判断。
以Python为例,可以这样写一个简单的包装器:
python复制import subprocess
import re
def identify_hash(h):
p = subprocess.run(['hashid', '-j', '-e', h], capture_output=True, text=True)
modes = re.findall(r'Hashcat: (\d+)', p.stdout)
return modes
hashes = ['e10adc3949ba59abbe56e057f20f883e', '$2a$10$...']
for h in hashes:
print(h, identify_hash(h))
这段脚本的作用是调用hashid并提取所有出现的Hashcat模式号,返回一个列表。好处是你能看到全部候选模式,而不是只有第一个。在自动流水线里,我建议的策略是:如果候选模式只有一个,直接进入破解;如果候选模式超过三个,先把哈希列入“存疑队列”,等人工复核后再处理。
另外要注意一点:hashid处理超大文件时性能没有明显瓶颈,但每一条哈希的执行都会产生子进程开销。如果哈希量达到几十万条,我建议直接用Python的hashid库函数方式调用,而不是反复subprocess。安装pip包后可以这样用:
python复制import hashid
它提供的API可以避免进程反复启动的性能损耗,批量处理时效率提升非常明显。
6. 同类型工具对比与使用建议
6.1 hashid与hash-identifier的关系
很多人分不清hashid和hash-identifier,包括我自己早期也搞混过。简单来说,hash-identifier是更早的PHP脚本工具,界面是交互式的,输入哈希后回显候选算法;而hashid是它的Python版重写,支持命令行参数、管道输入和批量处理。最早由psychonaut开发,后来项目迁移到GitHub上的psypanda/hashID仓库,名字虽然多变,功能基本是一致的。
如果你现在才刚开始用这类工具,我建议直接学hashid而不是hash-identifier。原因很简单:hashid支持-m和-j参数,可以直接输出John和Hashcat需要的格式编号;hash-identifier则更多地停留在“提示算法名”的阶段,和后续破解工具衔接不如hashid顺滑。从生态来看,hashid的维护活跃度更高,新算法支持也更及时。
不过hash-identifier也并非完全没用。在只有PHP环境、又不想装额外Python包的极简场景下,一个PHP脚本反而更轻量。而且它的交互式界面在偶尔用一次的场景下不需要记参数,上手零成本。我的建议是:日常主力用hashid,理解和熟悉它之后,再遇到hash-identifier也能秒上手。
6.2 结合John和Hashcat的实战姿势
在真实项目里,我见过太多人只把hashid当“哈希类型识别器”用,识别完就手工记下算法名,再去John或Hashcat里翻格式。这其实浪费了hashid最有价值的功能:直接输出格式编号。
用Hashcat模式举个例子:
bash复制hashid -j '$P$Bxyz...'
输出会显示(Hashcat: 400),这时候直接跑:
bash复制hashcat -m 400 -a 0 hash.txt rockyou.txt
中间完全不需要查格式表。John的场景同理:
bash复制hashid -m 'somehash'
然后根据输出格式名跑john --format=raw-md5 hash.txt。我在自动化脚本里最常用的是把hashid的输出解析后动态构造John或Hashcat命令,实现了“输入一批哈希,自动分流到不同破解任务”的效果。
这里补充一个实操细节:Hashcat的-m模式号有时候会根据版本变化,而hashid内置的模式号版本可能滞后。如果你发现hashid给出的模式号在Hashcat里提示无效,优先看hashcat --help里同算法的模式号是多少,或者去hashcat的example_hash页面确认最新编号。这种情况在冷门算法上出现概率更高,热门的如MD5(0)、SHA1(100)、NTLM(1000)反而很稳定。
6.3 什么时候不要用hashid
hashid虽然好用,但它不是万能的。我总结了三类不适合直接用hashid的情况。
第一类是哈希经过加盐且盐值格式不了解。比如某些框架对MD5做了自定义加盐处理,最后的字符串可能还是32位十六进制,但破解逻辑完全不同。hashid只能识别外部形态,无法判断内部是否加盐,这时候直接按MD5去跑往往无效。
第二类是哈希字符串经过了二次编码。比如把Base64编码后的哈希当普通字符串传入hashid,它会因为字符集不匹配而识别失败,或者误判成另一种格式。处理这类数据时,先做Base64解码,再重新识别。
第三类是极短或极长的自定义哈希。hashid内置的规则表覆盖的是常见算法,遇到自定义哈希函数或者非常稀有的算法时,输出往往要么为空,要么给出一堆完全无关的候选。这种情况就需要靠逆向分析或源码审计来解决问题,工具本身帮不上忙。
我在项目里习惯把hashid定位成“判断流程的第一步”而不是“唯一答案”。它用来缩小范围、快速分流、生成可执行的破解任务,但最终的确认还是要靠上下文分析和破解结果的交叉验证。有了这个意识,你在使用过程中就不会被工具的输出绑架,也不会因为一次误判就把时间浪费在错误方向上。
最后再分享一个小习惯。我每次遇到一种新哈希类型,都会顺手拿hashid过一遍,把它的输出长相记下来。时间久了,很多常见哈希一眼就能认出来,再配合hashid做验证,效率比单纯依赖工具高得多。说到底,hashid是一把好用的螺丝刀,但真正让工作流程顺畅的,还是你对哈希家族整体特征的理解和积累。
