人工智能、大数据、数据挖掘、机器学习-数据集来源(下)

本文涉及的产品
云原生大数据计算服务MaxCompute,500CU*H 100GB 3个月
云原生大数据计算服务 MaxCompute,5000CU*H 100GB 3个月
简介: 人工智能、大数据、数据挖掘、机器学习-数据集来源(下)

多伦多大学


http://www.cs.toronto.edu / 深入 / 数据 / datasets.html


UCI 知识发现 (KDD) 归档


http://kdd.ics.uci.edu/


信息和计算机科学


http://www.ics.uci.edu/


加州大学欧文分校


https://uci.edu/


互联网相关数据集


Dataset for “Statistics and SocialNetwork of YouTube Videos”


http://netsg.cs.sfu.ca/youtubedata/


1998 World Cup Web Site Access Logs


http://ita.ee.lbl.gov/html/contrib/WorldCup.html


(从 1998/04/26 到 1998/07/26 的 92 天中,发生了 1,352,804,107 次请求)


Page view statistics for Wikimedia projects


http://dammit.lt/wikistats/


AOL Search Query Logs - RP


http://www.researchpipeline.com/mediawiki/index.php?title=AOL_Search_Query_Logs


livedoor gourmet


http://blog.livedoor.jp/techblog/archives/65836960.html


离散序列数据


UNIX 用户数据


http://kdd.ics.uci.edu/databases/UNIX_user_data/UNIX_user_data.html


主菜芝加哥推荐数据


http://kdd.ics.uci.edu/databases/entree/entree.html


多元数据


人口收入调查数据库


http://kdd.ics.uci.edu/databases/census-income/census-income.html


线圈数据


http://kdd.ics.uci.edu/databases/coil/coil.html


Corel 图像特征


http://kdd.ics.uci.edu/databases/CorelFeatures/CorelFeatures.html


森林 CoverType


http://kdd.ics.uci.edu/databases/covertype/covertype.html


保险公司基准 (2000 卷)


http://kdd.ics.uci.edu/databases/tic/tic.html


互联网使用数据


http://kdd.ics.uci.edu/databases/internet_usage/internet_usage.html


IPUMS 人口普查数据


http://kdd.ics.uci.edu/databases/ipums/ipums.html


KDD CUP 1998 数据


http://kdd.ics.uci.edu/databases/kddcup98/kddcup98.html


KDD CUP 1999 数据


http://kdd.ics.uci.edu/databases/kddcup99/kddcup99.html


1990 年美国人口普查数据


http://kdd.ics.uci.edu/databases/census1990/USCensus1990.html


关系数据


大肠杆菌基因


http://kdd.ics.uci.edu/databases/ecoli/ecoli.html


结核分枝杆菌基因


http://kdd.ics.uci.edu/databases/tb/tb.html


电影


http://kdd.ics.uci.edu/databases/movies/movies.html


MovieLens 数据集


http://datahub.io/dataset/movielens


厄尔尼诺现象的数据


http://kdd.ics.uci.edu/databases/el_nino/el_nino.html


文本


20 新闻组数据


http://kdd.ics.uci.edu/databases/20newsgroups/20newsgroups.html


路透社 - 21578 文本分类收集


http://kdd.ics.uci.edu/databases/reuters21578/reuters21578.html


路透转录子集


http://kdd.ics.uci.edu/databases/reuters_transcribed/reuters_transcribed.html


摘要 1990- 2003 年 NSF 研究奖项


http://kdd.ics.uci.edu/databases/nsfabs/nsfawards.html


其他


http://www-2.cs.cmu.edu/afs/cs/project/theo-11/www/naive-bayes.html


http://www.w3.org/TR/WD-logfile-960221.html


http://www.w3.org/Daemon/User/Config/Logging.html#AccessLog


http://www.w3.org/1998/11/05/WC-workshop/Papers/bala2.html


http://www-2.cs.cmu.edu/afs/cs.cmu.edu/project/theo-11/www/wwkb/


http://www.web-caching.com/traces-logs.html


http://www-2.cs.cmu.edu/webkb


http://www.cs.auc.dk/research/DP/tdb/TimeCenter/TimeCenterPublications/TR-75.pdf


http://www.cs.cornell.edu/projects/kddcup/index.html



相关实践学习
基于MaxCompute的热门话题分析
本实验围绕社交用户发布的文章做了详尽的分析,通过分析能得到用户群体年龄分布,性别分布,地理位置分布,以及热门话题的热度。
SaaS 模式云数据仓库必修课
本课程由阿里云开发者社区和阿里云大数据团队共同出品,是SaaS模式云原生数据仓库领导者MaxCompute核心课程。本课程由阿里云资深产品和技术专家们从概念到方法,从场景到实践,体系化的将阿里巴巴飞天大数据平台10多年的经过验证的方法与实践深入浅出的讲给开发者们。帮助大数据开发者快速了解并掌握SaaS模式的云原生的数据仓库,助力开发者学习了解先进的技术栈,并能在实际业务中敏捷的进行大数据分析,赋能企业业务。 通过本课程可以了解SaaS模式云原生数据仓库领导者MaxCompute核心功能及典型适用场景,可应用MaxCompute实现数仓搭建,快速进行大数据分析。适合大数据工程师、大数据分析师 大量数据需要处理、存储和管理,需要搭建数据仓库?学它! 没有足够人员和经验来运维大数据平台,不想自建IDC买机器,需要免运维的大数据平台?会SQL就等于会大数据?学它! 想知道大数据用得对不对,想用更少的钱得到持续演进的数仓能力?获得极致弹性的计算资源和更好的性能,以及持续保护数据安全的生产环境?学它! 想要获得灵活的分析能力,快速洞察数据规律特征?想要兼得数据湖的灵活性与数据仓库的成长性?学它! 出品人:阿里云大数据产品及研发团队专家 产品 MaxCompute 官网 https://www.aliyun.com/product/odps 
相关文章
|
5月前
|
机器学习/深度学习 人工智能 搜索推荐
【数据挖掘】2022年深信服科技机器学习工程师笔试
总结了深信服科技机器学习工程师笔试中的几道题目及其解答,涉及数据结构、机器学习评估指标和过拟合缓解方法等内容。
99 1
|
4月前
|
机器学习/深度学习 数据采集 算法
数据挖掘和机器学习算法
数据挖掘和机器学习算法
|
5月前
|
机器学习/深度学习 存储 人工智能
【数据挖掘】2022年2023届秋招知能科技公司机器学习算法工程师 笔试题
本文是关于2022-2023年知能科技公司机器学习算法工程师岗位的秋招笔试题,包括简答题和编程题,简答题涉及神经网络防止过拟合的方法、ReLU激活函数的使用原因以及条件概率计算,编程题包括路径行走时间计算和两车相向而行相遇时间问题。
84 2
【数据挖掘】2022年2023届秋招知能科技公司机器学习算法工程师 笔试题
|
5月前
|
机器学习/深度学习 自然语言处理 算法
【数据挖掘】百度机器学习-数据挖掘-自然语言处理工程师 历史笔试详解
文章汇总并解析了百度机器学习/数据挖掘工程师/自然语言处理工程师历史笔试题目,覆盖了多分类任务激活函数、TCP首部确认号字段、GMM-HMM模型、朴素贝叶斯模型、SGD随机梯度下降法、随机森林算法、强连通图、红黑树和完全二叉树的高度、最长公共前后缀、冒泡排序比较次数、C4.5属性划分标准、语言模型类型、分词算法、贝叶斯决策理论、样本信息熵、数据降维方法、分箱方法、物理地址计算、分时系统响应时间分析、小顶堆删除调整等多个知识点。
52 1
【数据挖掘】百度机器学习-数据挖掘-自然语言处理工程师 历史笔试详解
|
5月前
|
机器学习/深度学习 人工智能 算法
【数据挖掘】2022年2023届秋招奇虎360机器学习算法工程师 笔试题
本文提供了奇虎360公司2022年秋招机器学习算法工程师岗位的笔试题内容,包括选择题和编程题,涉及概率统计、数据结构、机器学习、计算机组成原理等多个领域。
108 5
|
5月前
|
机器学习/深度学习 算法 数据挖掘
【数据挖掘】2022年2023届秋招宏瓴科技公司机器学习算法工程师 笔试题
关于宏瓴科技有限公司2022-2023年秋招机器学习算法工程师岗位的笔试题目及作者个人对部分题目的解答尝试,涉及贝叶斯误差和贝叶斯最优分类器的概念、贝叶斯误差的重要性和估算方法,以及如何有效利用训练集和测试集进行深度学习模型训练的数据集划分策略。
70 4
|
5月前
|
机器学习/深度学习 自然语言处理 算法
【数据挖掘】百度机器学习-数据挖掘-自然语言处理工程师 2023届校招笔试详解
百度2023届校招机器学习/数据挖掘/自然语言处理工程师笔试的题目详解
92 1
|
2月前
|
机器学习/深度学习 算法 数据挖掘
K-means聚类算法是机器学习中常用的一种聚类方法,通过将数据集划分为K个簇来简化数据结构
K-means聚类算法是机器学习中常用的一种聚类方法,通过将数据集划分为K个簇来简化数据结构。本文介绍了K-means算法的基本原理,包括初始化、数据点分配与簇中心更新等步骤,以及如何在Python中实现该算法,最后讨论了其优缺点及应用场景。
160 4
|
16天前
|
机器学习/深度学习 人工智能 算法
机器学习算法的优化与改进:提升模型性能的策略与方法
机器学习算法的优化与改进:提升模型性能的策略与方法
119 13
机器学习算法的优化与改进:提升模型性能的策略与方法
|
6天前
|
机器学习/深度学习 算法 网络安全
CCS 2024:如何严格衡量机器学习算法的隐私泄露? ETH有了新发现
在2024年CCS会议上,苏黎世联邦理工学院的研究人员提出,当前对机器学习隐私保护措施的评估可能存在严重误导。研究通过LiRA攻击评估了五种经验性隐私保护措施(HAMP、RelaxLoss、SELENA、DFKD和SSL),发现现有方法忽视最脆弱数据点、使用较弱攻击且未与实际差分隐私基线比较。结果表明这些措施在更强攻击下表现不佳,而强大的差分隐私基线则提供了更好的隐私-效用权衡。
38 14