设置
  • 日夜间
    随系统
    浅色
    深色
  • 主题色

全新神经网络架构KAN一夜爆火!200参数顶30万,MIT华人一作,轻松复现Nature封面AI数学研究

发布时间: 2024-05-06 12:46:44 来源: 量子位

对MLP“进行一个简单的更改”6lZ速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

白交 衡宇 发自 凹非寺6lZ速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

量子位 | 公众号 QbitAI6lZ速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

一种全新的神经网络架构KAN,诞生了!6lZ速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

与传统的MLP架构截然不同,且能用更少的参数在数学、物理问题上取得更高精度。6lZ速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

比如,200个参数的KANs,就能复现DeepMind用30万参数的MLPs发现数学定理研究。6lZ速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

不仅准确性更高,并且还发现了新的公式。要知道后者可是登上Nature封面的研究啊~6lZ速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

在函数拟合、偏微分方程求解,甚至处理凝聚态物理方面的任务都比MLP效果要好。6lZ速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

而在大模型问题的解决上,KAN天然就能规避掉灾难性遗忘问题,并且注入人类的习惯偏差或领域知识非常容易。6lZ速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

来自MIT、加州理工学院、东北大学等团队的研究一出,瞬间引爆一整个科技圈:Yes We KAN!6lZ速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

甚至直接引出关于能否替代掉Transformer的MLP层的探讨,有人已经准备开始尝试……6lZ速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

有网友表示:这看起来像是机器学习的下一步6lZ速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

让机器学习每个特定神经元的最佳激活,而不是由我们人类决定使用什么激活函数。6lZ速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

还有人表示:可能正处于某些历史发展的中间。6lZ速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

GitHub上也已经开源,也就短短两三天时间就收获1.1kStar。6lZ速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

对MLP“进行一个简单的更改”

跟MLP最大、也是最为直观的不同就是,MLP激活函数是在神经元上,而KAN把可学习的激活函数放在权重上。6lZ速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

在作者看来,这是一个“简单的更改”。6lZ速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

从数学定理方面来看,MLP的灵感来自于通用近似定理,即对于任意一个连续函数,都可以用一个足够深的神经网络来近似。6lZ速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

而KAN则是来自于 Kolmogorov-Arnold 表示定理 (KART),每个多元连续函数都可以表示为单变量连续函数的两层嵌套叠加。6lZ速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

KAN的名字也由此而来。6lZ速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

正是受到这一定理的启发,研究人员用神经网络将Kolmogorov-Arnold 表示参数化。6lZ速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

为了纪念两位伟大的已故数学家Andrey Kolmogorov和Vladimir Arnold,我们称其为科尔莫格罗夫-阿诺德网络(KANs)。6lZ速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

而从算法层面上看,MLPs 在神经元上具有(通常是固定的)激活函数,而 KANs 在权重上具有(可学习的)激活函数。这些一维激活函数被参数化为样条曲线。6lZ速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

在实际应用过程中,KAN可以直观地可视化,提供MLP无法提供的可解释性和交互性。6lZ速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

不过,KAN的缺点就是训练速度较慢。6lZ速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

对于训练速度慢的问题,MIT博士生一作Ziming Liu解释道,主要有两个方面的原因。6lZ速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

一个是技术原因,可学习的激活函数评估成本比固定激活函数成本更高。6lZ速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

另一个则是主观原因,因为体内物理学家属性抑制程序员的个性,因此没有去尝试优化效率。6lZ速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

对于是否能适配Transformer,他表示:暂时不知道如何做到这一点。6lZ速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

以及对GPU友好吗?他表示:还没有,正在努力中。6lZ速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

天然能解决大模型灾难性遗忘

再来看看KAN的具体实现效果。6lZ速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

神经缩放规律:KAN 的缩放速度比 MLP 快得多。除了数学上以Kolmogorov-Arnold 表示定理为基础,KAN缩放指数也可以通过经验来实现。6lZ速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

函数拟合方面,KAN比MLP更准确。6lZ速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

而在偏微分方程求解,比如求解泊松方程,KAN比MLP更准确。6lZ速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

研究人员还有个意外发现,就是KAN不会像MLP那样容易灾难性遗忘,它天然就可以规避这个缺陷。6lZ速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

好好好,大模型的遗忘问题从源头就能解决。6lZ速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

在可解释方面,KAN能通过符号公式揭示合成数据集的组成结构和变量依赖性。6lZ速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

人类用户可以与 KANs 交互,使其更具可解释性。在 KAN 中注入人类的归纳偏差或领域知识非常容易。6lZ速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

研究人员利用KANs还重新复现了DeepMind当年登上Nature的结果,并且还找到了Knot理论中新的公式,并以无监督的方式发现了新的结不变式关系。6lZ速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

△DeepMind登Nature研究成果6lZ速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

Deepmind的MLP大约300000 个参数,而KAN大约只有200 个参数。KAN 可以立即进行解释,而 MLP 则需要进行特征归因的后期分析。并且准确性也更高。6lZ速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

对于计算要求,团队表示论文中的所有例子都可以在单个CPU上10分钟内重现。6lZ速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

虽然KAN所能处理的问题规模比许多机器学习任务要小,但对于科学相关任务来说就刚刚好。6lZ速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

比如研究凝固态物理中的一种相变:安德森局域化。6lZ速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

好了,那么KAN是否会取代Transformer中的MLP层呢?6lZ速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

有网友表示,这取决于两个因素。6lZ速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

一点是学习算法,如 SGD、AdamW、Sophia 等—能否找到适合 KANs 参数的局部最小值?6lZ速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

另一点则是能否在GPU上高效地实现KANs层,最好能比MLPs跟快。6lZ速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

最后,论文中还贴心的给出了“何时该选用KAN?”的决策树。6lZ速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

那么,你会开始尝试用KAN吗?还是让子弹再飞一会儿~6lZ速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

项目链接:6lZ速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM
https://kindxiaoming.github.io/pykan/6lZ速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM
论文链接:6lZ速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM
https://arxiv.org/abs/2404.197566lZ速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM
参考链接:6lZ速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM
[1]https://twitter.com/ZimingLiu11/status/17854839677199815386lZ速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM
[2]https://twitter.com/AnthropicAI/status/17857014185461803266lZ速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

眼眸深邃似海、璨如星河,中国医学科学院生物医学工程研究所眼科诊疗技术研发团队(以下简称“团队”)正是眼眸“侦探”。该团队不久前被授予“国家卓越工程师团队”称号。别看人眼只有8克左右,却 记者从中国航天科技集团获悉,3月21日13时27分,长征二号丁运载火箭/远征三号上面级在酒泉卫星发射中心起飞,随后将云海二号02组卫星送入预定轨道,发射任务取得圆满成功。云海二号02组卫星由中国航 21世纪经济报道记者 冯恋阁 王俊 广州、北京报道2013年播出的科幻电视剧《黑镜》第二季中有这样一个故事——女主角玛莎在男友艾什被车祸夺走生命之后,长久无法走出分离的痛苦,最终选   “AI钢铁侠”黄仁勋,又进化了英伟达  作 者丨倪雨晴  2024年,英伟达一年一度的GTC大会已然成为AI界春晚,现场座无虚席,全球AI爱好者翘首以待黄仁勋的独家SOLO。  北京时间3月19日凌晨,GTC终于拉开大幕。英伟达创 3月25日消息,去年huawei在Mate 60系列上首发了玄武机身架构,采用一体化金属机身,搭配上超耐用锦纤材质,使整机的抗挤压能力提高10倍,使用更放心。“玄武”是极其坚固的代表,huawei还在问界M9上采用了“ 联合国政府间气候变化专门委员会(IPCC)最新发布的评估报告显示,全球温升预计在2021年至2040年内达到1.5℃。报告指出,自IPCC第五次评估报告发布以来,全球减缓气候变化的政策和法律不断增多,但实施 。

本文链接:全新神经网络架构KAN一夜爆火!200参数顶30万,MIT华人一作,轻松复现Nature封面AI数学研究http://www.sushuapos.com/show-2-5648-0.html

声明:本网站为非营利性网站,本网页内容由互联网博主自发贡献,不代表本站观点,本站不承担任何法律责任。天上不会到馅饼,请大家谨防诈骗!若有侵权等问题请及时与本网联系,我们将在第一时间删除处理。

上一篇: 奥特曼承认了神秘gpt2!哈佛MIT巡演继续,斯坦福演讲完整版公开

下一篇: 记者观察:6G已在路上,标准向全球统一推进

热门资讯

推荐资讯

  • 日榜
  • 周榜
  • 月榜