研究人员开发了一个新的框架,用于分析纵向网络爬取数据,即演变中的URL群体的顺序样本。该框架引入了“发现曲线”来衡量爬取窗口内的累积URL足迹。通过将发现曲线与成对包含分析进行比较,研究人员在应用于Common Crawl和德国学术网络档案时,发现了预测上的分歧。这些差异表明网络存在一个由持久核心和动态外壳组成的双组分模型,该模型能更好地调和观测到的数据。 AI
排序理由 该集群包含一篇学术论文,详细介绍了一种分析网络爬取数据的新方法。[lever_c_demoted from research: ic=1 ai=0.1]
在 arXiv cs.IR (Information Retrieval) 阅读 →
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →