服务器之家:专注于VPS、云服务器配置技术及软件下载分享
分类导航

PHP教程|ASP.NET教程|Java教程|ASP教程|编程技术|正则表达式|C/C++|IOS|C#|Swift|Android|VB|R语言|JavaScript|易语言|vb.net|

服务器之家 - 编程语言 - 编程技术 - HTML转义字符&npsp;表示non-breaking space \xa0

HTML转义字符&npsp;表示non-breaking space \xa0

2020-08-23 17:12my8100 编程技术

HTML转义字符&npsp;表示non-breaking space,unicode编码为u'\xa0',超出gbk编码范围,这里就为大家分享一下

1.参考

beautiful soup and unicode problems

详细解释

unicodedata.normalize('nfkd',string) 实际作用???

scrapy : select tag with non-breaking space with xpath

?
1
2
3
>>> selector.xpath(u'''
... //p[normalize-space()]
... [not(contains(normalize-space(), "\u00a0"))]

normalize-space() 实际作用???

in [244]: sel.css('.content')
out[244]: [<selector xpath=u"descendant-or-self::*[@class and contains(concat(' ', normalize-space(@class), ' '), ' content ')]" data=u'<p class="content text-

beautifulsoup下unicode乱码解决

今天在用scrapy爬某个网站的数据,其中dom解析我用的是beautifulsoup,速度上没有xpath来得快,不过因为用了习惯了,所以一直用的bs,版本是bs4
不过在爬取过程中遇到了一些问题,其中一个是unicode转码问题,这也算是python中一个著名问题了。
我遇到的算是beautifulsoup中的一个奇葩bug吧,在网页中经常会有 &nbsp 这种标记,称为 non-breaking space character, 本来这个应该是忽略的,但在bs中会把这个符号
转义成为一个unicode编码 \xa0, 这就导致了后面如果要对内容处理的话会出现unicodeerror, 特别是如果使用的是console或者scrapy中写文件、写数据库的pipeline操作时,
出现无法转义的错误。
那么该如何解决呢,其实不难

s = u'\xa0'
s.replace(u'\xa0', u'')

之后就可以对s进行encode,比如:

s = u'\xa0'
s.replace(u'\xa0', u'').encode('utf-8')

特别是在我的项目中,如果需要把数据写到mongodb中,这个bug fix完后,写数据立刻搞定,爬取的内容全部写到mongodb中。

s.replace(u'\xa0', u'').encode('utf-8')

2.问题定位

https://en.wikipedia.org/wiki/comparison_of_text_editors

定位元素显示为 &npsp;

HTML转义字符&npsp;表示non-breaking space \xa0

网页源代码表示为 &#160;

?
1
2
3
4
5
6
7
<tr>
<td style="background: #ffd; color: black; vertical-align: middle; text-align: center;" class="partial table-partial">memory</td>
<td>= limited by available memory &#160;&#160;</td>
<td style="background:#f99;vertical-align:middle;text-align:center;" class="table-no">no (64&#160;kb)</td>
<td>= some limit less than available memory (give max size if known)</td>
</tr>
</table>

实际传输hex为:

HTML转义字符&npsp;表示non-breaking space \xa0

不间断空格的unicode表示为 u\xa0',保存的时候编码 utf-8 则是 '\xc2\xa0'

in [211]: for tr in response.xpath('//table[8]/tr[2]'):
...: print [u''.join(i.xpath('.//text()').extract()) for i in tr.xpath('./*')]
...:

[u'memory', u'= limited by available memory \xa0\xa0', u'no (64\xa0kb)', u'= some limit less than available memory (give max size if known)']

in [212]: u'no (64\xa0kb)'.encode('utf-8')
out[212]: 'no (64\xc2\xa0kb)'

in [213]: u'no (64\xa0kb)'.encode('utf-8').decode('utf-8')
out[213]: u'no (64\xa0kb)'

保存 csv 直接使用 excel 打开会有乱码(默认ansi gbk 打开???,u'\xa0' 超出 gbk 能够编码范围???),使用记事本或notepad++能够自动以 utf-8 正常打开。

HTML转义字符&npsp;表示non-breaking space \xa0

使用记事本打开csv文件,另存为 ansi 编码,之后 excel 正常打开。超出 gbk 编码范围的替换为'?'

HTML转义字符&npsp;表示non-breaking space \xa0

3.如何处理

.extract_first().replace(u'\xa0', u' ').strip().encode('utf-8','replace')

以上就是html转义字符&npsp;表示non-breaking space \xa0的详细内容,更多关于html转义字符\xa0的资料请关注服务器之家其它相关文章!

原文链接:https://www.cnblogs.com/my8100/p/7709371.html

延伸 · 阅读

精彩推荐
  • 编程技术真正聪明的程序员,总有办法不加班

    真正聪明的程序员,总有办法不加班

    工作效率提升了,就可以少加班了,聪明的程序员,总会有一堆可以提升编码效率的工具?当一种工具满足不了工作需求,就去探索新的,今天纬小创就给...

    今日头条12482021-03-04
  • 编程技术AIOps,SRE工程师手中的利器

    AIOps,SRE工程师手中的利器

    AIOps开始成为一种极为重要的站点可靠性工程工具。它能够高效吸纳观察数据、参与数据以及来自第三方工具的数据,判断系统运行状态并保证其处于最佳...

    至顶网5962021-03-08
  • 编程技术从Context源码实现谈React性能优化

    从Context源码实现谈React性能优化

    这篇文章主要介绍Context的实现原理,源码层面掌握React组件的render时机,从而写出高性能的React组件,源码层面了解shouldComponentUpdate、React.memo、PureComponen...

    魔术师卡颂5312020-12-20
  • 编程技术2021年值得关注的React PDF 库

    2021年值得关注的React PDF 库

    今天,许多网络应用程序为其用户提供内置的PDF浏览选项。然而,选择一个并不容易,因为它们的功能远远超过显示PDF。在这篇文章中,我将评估5个React的...

    TianTianUp5222021-06-21
  • 编程技术简单、好懂的Svelte实现原理

    简单、好懂的Svelte实现原理

    本文会围绕一张流程图和两个Demo讲解,正确的食用方式是用电脑打开本文,跟着流程图、Demo一边看、一边敲、一边学...

    魔术师卡颂4822021-11-10
  • 编程技术用户态 Tcpdump 如何实现抓到内核网络包的?

    用户态 Tcpdump 如何实现抓到内核网络包的?

    在网络包的发送和接收过程中,绝大部分的工作都是在内核态完成的。那么问题来了,我们常用的运行在用户态的程序 tcpdump 是那如何实现抓到内核态的包...

    开发内功修炼11612021-09-08
  • 编程技术Delphi - Indy idMessage和idSMTP实现邮件的发送

    Delphi - Indy idMessage和idSMTP实现邮件的发送

    这篇文章主要介绍了Delphi - Indy idMessage和idSMTP实现邮件的发送,本文通过实例代码给大家介绍的非常详细,具有一定的参考借鉴价值,需要的朋友可以参考下...

    JJ_JeremyWu6592020-09-22
  • 编程技术让开发效率倍增的 VS Code 插件

    让开发效率倍增的 VS Code 插件

    今天来分享一些提升开发效率的实用 VS Code 插件!Better Comments 扩展可以帮助我们在代码中创建更人性化的注释,有不同形式和颜色的注释供我们选择。 ...

    前端充电宝7132022-04-21