多视图数据虽然能够提供更加丰富的信息,但并不是“信息越多越好”。实际数据中往往存在大量噪声特征和冗余特征,这些无关信息反而可能干扰模型学习。

因此,在一个不完全多视图聚类项目中,我们尝试采用一种比较直观的思路:先进行特征筛选,再进行多视图表示学习。

在得到更加有效的特征之后,再将不同视图的信息划分为“共享信息”和“私有信息”。共享部分用于学习不同视图之间的一致性,而私有部分则保留每个视图自身的特点。

这个项目让我认识到,模型结构并不一定越复杂越好。很多时候,从数据本身存在的问题出发,把整个学习过程拆解清楚,反而更容易找到有效的改进方向。

最近咸鱼收了一台玩客云重新折腾了起来。最开始只是想搭一个属于自己的博客,后来越折腾功能越多,最后它已经有点像一台真正属于自己的小服务器了。

我给它刷上了海纳思系统,并把 Typecho 部署在上面,搭出了现在这个个人博客。为了能够在外网访问,又配置了 Tailscale,让我不在家时也可以安全地连接这台设备。

之后又接入了一块固态硬盘,把它作为主要的数据存储空间,并利用 Syncthing 搭建了一套自动同步的 NAS。现在电脑中指定文件夹里的文件只要发生变化,就会自动同步到家里的硬盘中,同时还设置了历史版本保留,减少误删或覆盖文件带来的风险。

为了不只是面对一堆文件路径和命令行,我还配置了 AList,把 NAS 中的文件变成了可以直接通过网页浏览的网盘界面,并顺手换上了自己喜欢的背景。

整个过程其实遇到了不少问题:端口、Nginx、PHP、Tailscale 掉线、文件权限、同步速度……很多东西都是第一次接触。但也正因为这样,我第一次比较完整地理解了一个网站从“能运行”到“能够被访问”,以及数据从电脑自动同步到服务器的大致过程。

现在这台小小的玩客云同时承担着博客、NAS 和文件管理的功能。性能谈不上多强,但它确实已经成为了一台真正属于自己的小服务器。

折腾本身,也挺有意思。