解压文件而不创建临时文件

Question

20 浏览2023年4月9日

匿名的 2023年4月10日

0 Comments

我从AWS S3下载了一个zip文件并解压缩了它。解压缩后，所有文件都保存在tmp/文件夹中。

s3 = boto3.client('s3')
s3.download_file('testunzipping','DataPump_10000838.zip','/tmp/DataPump_10000838.zip')
with zipfile.ZipFile('/tmp/DataPump_10000838.zip', 'r') as zip_ref:
    zip_ref.extractall('/tmp/')
    lstNEW = zip_ref.namelist()

listNEW的输出如下所示：

['DataPump_10000838/', '__MACOSX/._DataPump_10000838', 'DataPump_10000838/DockBooking', '__MACOSX/DataPump_10000838/._DockBooking', 'DataPump_10000838/LoadEquipment', '__MACOSX/DataPump_10000838/._LoadEquipment', ....]

LoadEquipment和DockBooking是文件，而其他都不是。有没有可能在解压缩文件时不创建这些临时文件？或者有没有可能筛选出真正的文件？因为之后我需要使用正确的文件并对它们进行gzip压缩。

我是否使用压缩函数？

0

1 答案

匿名的 · Answer 1 · 2023-07-15T11:56:51+00:00

问题的出现原因是，当解压缩zip文件时，会出现一些不是临时文件而是macOS对于在不支持资源分支的zip文件中表示资源分支的方式。

为了解决这个问题，可以使用lambda函数过滤掉以"__MACOSX/"开头的文件名，然后将剩下的文件进行解压缩。下面是一个示例代码：

with zipfile.ZipFile('/tmp/DataPump_10000838.zip', 'r') as zip_ref:
    lstNEW = list(filter(lambda x: not x.startswith("__MACOSX/"), zip_ref.namelist()))
    zip_ref.extractall('/tmp/', members=lstNEW)

需要注意的是，这种解决方法只适用于macOS系统。如果在AWS上运行自动流水线时，是否仍然适用取决于所使用的操作系统。因为这是一种非标准的macOS约定，苹果公司可以随时更改。但迄今为止，他们一直使用特殊名称"__MACOSX"来表示资源分支。