码迷,mamicode.com
首页 > Web开发 > 详细

Golang html encoding解析

时间:2018-07-28 15:26:01      阅读:342      评论:0      收藏:0      [点我收藏+]

标签:out   解析   func   close   col   org   依赖   %s   transform   

自动解析html页面的编码格式:

需要依赖 golang.org/x/text 和 golang.org/x/net 这两个外部库

package main

import (
    "net/http"
    "io/ioutil"
    "fmt"
    "golang.org/x/text/transform"
    "io"
    "golang.org/x/text/encoding"
    "bufio"
    "golang.org/x/net/html/charset"
)

// encoding determine for html page , eg: gbk gb2312 GB18030
func determineEncoding(r io.Reader) encoding.Encoding {
    bytes, err := bufio.NewReader(r).Peek(1024)
    if err != nil {
        panic(err)
    }
    e, _, _ := charset.DetermineEncoding(bytes, "")
    return e
}

func main() {
    resp, err := http.Get("http://www.zhenai.com/zhenghun")
    if err != nil {
        panic(err)
    }
    defer resp.Body.Close()

    e := determineEncoding(resp.Body)
    reader := transform.NewReader(resp.Body, e.NewDecoder())
    if resp.StatusCode == http.StatusOK {
        bodyBytes, err := ioutil.ReadAll(reader)
        if err != nil {
            panic(err)
        }
        fmt.Printf("%s\n", bodyBytes)
    }
}

 

Golang html encoding解析

标签:out   解析   func   close   col   org   依赖   %s   transform   

原文地址:https://www.cnblogs.com/vincenshen/p/9381810.html

(0)
(0)
   
举报
评论 一句话评论(0
登录后才能评论!
© 2014 mamicode.com 版权所有  联系我们:gaon5@hotmail.com
迷上了代码!