使用wget递归地获取包含任意文件的目录

我有一个web目录，我存储一些配置文件。我想使用wget将这些文件拉下来并保持它们当前的结构。例如，远程目录看起来像:

http://mysite.com/configs/.vim/

.vim包含多个文件和目录。我想用wget在客户端复制它。似乎无法找到正确的wget标志组合来完成这项工作。什么好主意吗?

当前回答

wget -r http://mysite.com/configs/.vim/

对我有用。

也许你有一个。wgetrc干扰它?

2008-11-07 21:49:42

其他回答

对于其他有类似问题的人。Wget遵循robots.txt，这可能不允许您抓取站点。不用担心，你可以把它关掉:

wget -e robots=off http://www.example.com/

http://www.gnu.org/software/wget/manual/html_node/Robot-Exclusion.html

2012-11-22 20:36:10

这个版本递归下载，不创建父目录。

wgetod() {
    NSLASH="$(echo "$1" | perl -pe 's|.*://[^/]+(.*?)/?$|\1|' | grep -o / | wc -l)"
    NCUT=$((NSLASH > 0 ? NSLASH-1 : 0))
    wget -r -nH --user-agent=Mozilla/5.0 --cut-dirs=$NCUT --no-parent --reject="index.html*" "$1"
}

用法:

添加到~/。Bashrc或粘贴到终端 wgetod“http://example.com/x/”

2017-10-18 23:31:27

递归下载一个目录，该目录拒绝index.html*文件，下载时不包含主机名、父目录和整个目录结构:

wget -r -nH --cut-dirs=2 --no-parent --reject="index.html*" http://mysite.com/dir1/dir2/data

2011-03-17 06:17:28

你所需要的是两个标志，一个是“-r”表示递归，另一个是“——no-parent”(或-np)，以便不进入'。和“..”．是这样的:

Wget -r——no-parent http://example.com/configs/.vim/

就是这样。它将下载到以下本地树:./example.com/configs/.vim。然而，如果你不想要前两个目录，那么使用额外的标志——cut-dirs=2，就像之前的回复中建议的那样:

Wget -r——no-parent——cut-dirs=2 http://example.com/configs/.vim/

它只会把你的文件树下载到。/.vim/

事实上，我从wget手册中得到了这个答案的第一行，他们在4.3节的末尾有一个非常干净的例子。

2018-03-02 06:32:58

下面是完整的wget命令，用于从服务器目录下载文件(忽略robots.txt):

wget -e robots=off --cut-dirs=3 --user-agent=Mozilla/5.0 --reject="index.html*" --no-parent --recursive --relative --level=1 --no-directories http://www.example.com/archive/example/5.3.0/

2013-02-15 12:26:50

使用wget递归地获取包含任意文件的目录

推荐文章

最新文章

标签