python爬虫实战(8)--获取虎pu热榜

1. 需要的类库

import requests
from bs4 import BeautifulSoup
import pandas as pd

2. 请求地址

def fetch_data():
    url = "https://bbs.xxx.com/"  # Replace with the actual base URL
    response = requests.get(url)

    if response.status_code == 200:
        return response.content
    else:
        print(f"Error fetching data. Status code: {response.status_code}")
        return None

3. 编码

def parse_html(html_content, base_url):
    soup = BeautifulSoup(html_content, 'html.parser')
    items = soup.find_all('div', class_='text-list-model')
    first_item = items[0]
    contents = first_item.contents
    data = []
    for item in contents:
        if item.select_one('.t-title') == None:
            continue
        title = item.select_one('.t-title').text.strip()
        relative_url = item.select_one('a')['href']
        full_url = base_url + relative_url
        lights = item.select_one('.t-lights').text.strip()
        replies = item.select_one('.t-replies').text.strip()

        data.append({
            'Title': title,
            'URL': full_url,
            'Lights': lights,
            'Replies': replies
        })

    return data

注意:分析标签,这里加了非意向标签的跳过处理

4. 导出表格

def create_excel(data):
    df = pd.DataFrame(data)
    df.to_excel('hupu-top.xlsx', index=False)
    print("Excel file created successfully.")

测试

    base_url = "https://bbs.xx.com" #替换成虎pu首页地址
    html_content = fetch_data()

    if html_content:
        forum_data = parse_html(html_content, base_url)
        create_excel(forum_data)
    else:
        print("Failed to create Excel file.")

5. 成果展示

在这里插入图片描述

相关推荐

  1. python爬虫实战(6)--获取某度

    2024-01-11 12:52:02       36 阅读

最近更新

  1. TCP协议是安全的吗?

    2024-01-11 12:52:02       16 阅读
  2. 阿里云服务器执行yum,一直下载docker-ce-stable失败

    2024-01-11 12:52:02       16 阅读
  3. 【Python教程】压缩PDF文件大小

    2024-01-11 12:52:02       15 阅读
  4. 通过文章id递归查询所有评论(xml)

    2024-01-11 12:52:02       18 阅读

热门阅读

  1. 【打卡】牛客网:BM79 打家劫舍(二)

    2024-01-11 12:52:02       40 阅读
  2. 算法:A*算法最小实例

    2024-01-11 12:52:02       33 阅读
  3. C++经典程序

    2024-01-11 12:52:02       34 阅读
  4. 【金融支付】常用术语和定义

    2024-01-11 12:52:02       32 阅读
  5. 一、SpringBoot框架搭建

    2024-01-11 12:52:02       34 阅读
  6. C/C++-传值/地址的区别

    2024-01-11 12:52:02       28 阅读
  7. 在IntelliJ IDEA中,.idea文件是什么,可以删除吗

    2024-01-11 12:52:02       33 阅读
  8. Crow:路由局部插件2 调用before_handle

    2024-01-11 12:52:02       40 阅读
  9. C++入门级程序day1

    2024-01-11 12:52:02       36 阅读