当前位置：首页 > news >正文

网站建设加盟哪个好/北京谷歌seo公司

news 2025/7/1 9:08:39

网站建设加盟哪个好,北京谷歌seo公司,平台推广应用,进行公司网站建设方案作者：法纳斯特（本文来自作者投稿，简介见末尾） 近日，民谣歌手花粥被爆出涉嫌抄袭。具体的我就不细说了，音乐圈的抄袭风波也是喜闻乐见。比如，李袁杰的「离人愁」，展展与罗罗的「…

阿里云幸运券

作者：法纳斯特（本文来自作者投稿，简介见末尾）

近日，民谣歌手花粥被爆出涉嫌抄袭。

具体的我就不细说了，音乐圈的抄袭风波也是喜闻乐见。

比如，李袁杰的「离人愁」，展展与罗罗的「沙漠骆驼」还有陈柯宇的「生僻字」。

本次通过爬取网易云音乐的评论，即目前热歌榜第一名「出山」的评论。

来看看，在没被指出抄袭时，歌曲的评论画风是如何。

被指出抄袭后，又是怎样的一个画风。

/ 01 / 网页分析

网上关于爬取网易云音乐评论的方法，大多数都是讲如何构建参数去破解。

事实上不用那么复杂，直接调用接口就可以。

而且网易云音乐对评论也做了限制，只放出了2万条的评论数据。

前后各一万，即评论的前500页和后500页。

最后一页为10079，减500页应该是9579，然后你会发现9575页和9579页的数据是一模一样的。

同样，501页和502页的数据也是一模一样的。

所以何必想着去构造参数，直接调用网易云音乐的评论API就是了，用户信息也是一个道理。

网易云音乐评论API,其中1313354324为音乐ID,limit为页面结果限制数,最大可设为100,offset为页面偏移量

http://music.163.com/api/v1/resource/comments/R_SO_4_1313354324?limit=20&offset=0

用户信息API

https://music.163.com/api/v1/user/detail/{用户ID}

这里就以花粥的「出山」为例，具体情况如下。

第一页妥妥的差评。这两天「出山」的评论区热闹非凡。

大部分的评论都是希望能尊重原创，然后下架花粥的歌。

当然，也有不少给花粥洗白的水军在评论区游荡…

/ 02 / 评论获取

具体代码如下。

import json
import time
import requests

headers = {
‘Host’: ‘music.163.com’,
‘User-Agent’: ‘Mozilla/5.0 (Windows NT 6.1; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/63.0.3239.132 Safari/537.36’
}

def get_comments(page):
“”"
获取评论信息
“”"
url = ‘http://music.163.com/api/v1/resource/comments/R_SO_4_1313354324?limit=20&offset=’ + str(page)
response = requests.get(url=url, headers=headers)
# 将字符串转为json格式
result = json.loads(response.text)
items = result[‘comments’]
for item in items:

    # 用户名user_name = item['user']['nickname'].replace(',', '，')# 用户IDuser_id = str(item['user']['userId'])# 获取用户信息user_message = get_user(user_id)# 用户年龄user_age = str(user_message['age'])# 用户性别user_gender = str(user_message['gender'])# 用户所在地区user_city = str(user_message['city'])# 个人介绍user_introduce = user_message['sign'].strip().replace('\n', '').replace(',', '，')# 评论内容comment = item['content'].strip().replace('\n', '').replace(',', '，')# 评论IDcomment_id = str(item['commentId'])# 评论点赞数praise = str(item['likedCount'])# 评论时间date = time.localtime(int(str(item['time'])[:10]))date = time.strftime("%Y-%m-%d %H:%M:%S", date)print(user_name, user_id, user_age, user_gender, user_city, user_introduce, comment, comment_id, praise, date)with open('music_comments.csv', 'a', encoding='utf-8-sig') as f:f.write(user_name + ',' + user_id + ',' + user_age + ',' + user_gender + ',' + user_city + ',' + user_introduce + ',' + comment + ',' + comment_id + ',' + praise + ',' + date + '\n')f.close()

def get_user(user_id):
“”"
获取用户注册时间
“”"
data = {}
url = ‘https://music.163.com/api/v1/user/detail/’ + str(user_id)
response = requests.get(url=url, headers=headers)
# 将字符串转为json格式
js = json.loads(response.text)
if js[‘code’] == 200:
# 性别
data[‘gender’] = js[‘profile’][‘gender’]
# 年龄
if int(js[‘profile’][‘birthday’]) < 0:
data[‘age’] = 0
else:
data[‘age’] = (2018 - 1970) - (int(js[‘profile’][‘birthday’]) // (1000 * 365 * 24 * 3600))
if int(data[‘age’]) < 0:
data[‘age’] = 0
# 城市
data[‘city’] = js[‘profile’][‘city’]
# 个人介绍
data[‘sign’] = js[‘profile’][‘signature’]
else:
data[‘gender’] = ‘无’
data[‘age’] = ‘无’
data[‘city’] = ‘无’
data[‘sign’] = ‘无’
return data

def main():
# 前500页
# for i in range(210000, 230000, 20):
# 后500页
for i in range(0, 25000, 20):
print(’\n---------------第 ’ + str(i // 20 + 1) + ’ 页---------------’)
get_comments(i)

if name == ‘main’:
main()

最后成功获取评论信息。

包含了用户名、用户ID、年龄、性别、区域编码、个人介绍、评论、评论ID、点赞数、评论发表时间。

按理说获取前500页，应该是有1w条的评论。

这里主要是因为大家刷的太快，页面信息一直在改变，所以必然会遗漏一些数据。

后500页还算完整的，就差了500条。

总共加起来1.7w条，数据量还是比较可观的，而且能发现不少信息。

/ 03 / 数据可视化

1 评论词云图

评论的词云图，经过抄袭风波，画风绝对不同。

第一张为歌曲发布后的评论词云，第二张为被爆抄袭后的评论词云。

前者是「喜欢」「好听」，后者却是「抄袭」「侵权」。