seek()在大文件中常失效或不准,因文本模式按字符读取而seek()按字节跳转,UTF-8下多字节字符易导致越界解码错误;必须用'rb'模式并确保跳转位置为合法字节边界。
seek() 在大文件里经常失效或不准?因为文本文件默认按字符读取,而 seek() 是按字节跳转的——UTF-8 编码下中文、emoji 等字符占 2~4 字节,直接 seek(100) 可能落在某个汉字中间,后续 readline() 就会报 UnicodeDecodeError 或返回乱码。
'rb')才能安全 seek():跳转只认字节位置,不解析编码'r')下 seek() 仅允许跳到 0 或之前 tell() 返回的位置(即只能跳回已读过的地方)seek(N) 猜位置,得先建索引(如记录每行起始偏移)seek() 安全跳转到指定字节位置并读取?适用于日志分析、二进制数据提取等场景,前提是你知道目标位置是合法字节边界(比如固定长度记录、已知结构的文件头)。
open(..., 'rb') 打开文件f.seek(offset, whence=0):其中 whence=0 表示从文件开头算,1 从当前位置,2 从末尾(注意:末尾用 whence=2 后 seek(-10, 2) 表示倒数第 10 字节)f.read(n) 读字节,再按需解码(如 data.decode('utf-8', errors='ignore'))with open('large.log', 'rb') as f: f.seek(1024 * 1024) # 跳到 1MB 处 chunk = f.read(1024) # 读 1KB text = chunk.decode('utf-8', errors='replace')
核心是预建行偏移索引——遍历一次文件,记录每行开头的字节位置。之后每次读第 N 行只需 seek() 到该位置,再 readline()。
.idx 文件或内存列表;若文件不变,建一次即可复用'rb' 模式,逐字节找 b'n',避免编码问题offsets[0],第 N 行用 f.seek(offsets[N]),然后 f.readline()
# 构建索引(一次)offsets = [0]with open('big.txt', 'rb') as f: while f.readline(): offsets.append(f.tell())# 随机读第 100 行with open('big.txt', 'rb') as f: f.seek(offsets[100]) line = f.readline().decode('utf-8', errors='ignore')
mmap 替代 seek() 会更高效吗?对超大文件(GB 级以上),mmap 可避免频繁系统调用,适合随机访问固定偏移区域,但不解决“按行读”的语义问题。
立即学习“Python免费学习笔记(深入)”;
mmap 是内存映射,seek() 是文件指针移动——两者机制不同,不能混用mmap 后直接切片:mm[1000:1024],比 seek()+read() 少一次 I/Ommap 占用虚拟内存,关闭前要 mm.close();Windows 下打开文件需加 access=mmap.ACCESS_READ
import mmapwith open('huge.bin', 'rb') as f: with mmap.mmap(f.fileno(), 0, access=mmap.ACCESS_READ) as mm: chunk = mm[512*1024:512*1024+1024] # 直接切片读
实际用 seek() 做随机读,本质是在和文件编码、行结构、I/O 缓冲博弈。最易被忽略的是:你以为跳到了“第 100 行开头”,其实只是跳到了“字节位置 12345”,而那里可能是半截 UTF-8 字符,也可能是换行符中间。