Yesterday
我在 macOS 上日常用得最多的软件是 contexts,这是一个窗口 switcher,但这个软件似乎好几年都没更新了。我之前还发邮件去问过作者,他回复说一切都工作得很好,也没有什么新功能想法,所以就一直没更新。
然后某天我看到有的人用 Rust 实现了跨平台的输入法,于是我就起了个新坑,尝试用 AI 来帮我重新实现类似 Contexts 的工具,整个过程比较顺利,项目代码在 Winlane。
Contexts 有很多配置项,但我只用它最核心的窗口切换功能。而做完这些基础功能之后我又忍不住继续把我日常依赖的一些小工具都重新实现成了 Winlane 里面的命令。主要有:
Raycast:...
2 days ago
今天试用了一个 Omarchy Workspace Manager 插件,发现不符合自己的需求后就卸载了。结果卸载完以后,Alt + Tab、Super + Tab、Super + H/J/K/L 全部失效,就连我自己写的几个 Omarchy 插件也像坏了一样,所有快捷键按下去都没有反应。
一开始以为是 Omarchy Shell 热重载把插件搞坏了,重启了一次 Omarchy Shell:
omarchy restart shell
但是问题依旧。
排查过程
先检查 Hyprland 的快捷键绑定:
hyprctl binds
文章中配置的快捷键都还在,Alt + Tab ...
3 days ago
我的第三个 Omarchy 插件
以前 Linux 的电源管理做得都特别复杂,特别是你干活的时候就给你屏保了。
其实 AI 时代的逻辑很简单,就是插电的时候不要屏保。我可以不动电脑,但是我时不时地瞟一眼 AI 干完活没有,这很重要。
所以我做了我的第三个 Omarchy 插件:笔记本插电的时候禁用一切屏保和省电模式,只有拔电的时候才启用电源管理。这样既满足了移动续航的需求,又保证我们平常工作中,不管是看 AI 发呆还是开会看 PPT,都不受 Linux 蹩脚的电源管理限制。如果真的要离开一会儿,为了保证安全,手动锁屏一下就好了。
代码用 GPL 3.0 开源,放到评论区,Enjoy O...
我的第四个 Omarchy 插件
Omarchy 是一个 Tile WM,多个窗口平铺的时候,配合半透明的窗口,隐隐约约能看到下面的桌面壁纸,确实很赛博朋克,也很好看。
但是一些效率应用,比如浏览器或者文件管理器,单独放在一个工作区的时候,如果工作区只有一个窗口,依然显示窗口周边的空隙和描边,就不是那么好看,而且浪费屏幕空间,少了沉浸工作的感觉。
所以我写了 Omarchy Smart Gaps 这个插件。当工作区只有一个窗口的时候,自动隐藏窗口周边的空隙和描边,让工作更加专注。
代码按照 GPL 3.0 开源,评论区有链接,Enjoy!
我的第二个 Omarchy 插件
Omarchy 整个系统的默认设计非常简洁,特别适合工程师。只是默认的托盘设计是在右上角放一个箭头,每次查看托盘消息,都需要小心翼翼地点击箭头,等显示动画弹出来以后才能点击应用托盘图标。这个设计模仿自 GNOME Shell,好看是好看,但是非常不实用。
我重新设计了一个插件 Omarchy Tray Bar,安装以后自动展示所有托盘,随时随地都可以看到托盘状态,点击也非常直观高效。
源代码按照我最喜欢的 GPL 3.0 发布,放到评论区了,稍后发布到 Omarchy 插件商店。
我的第一个 Omarchy 插件
Omarchy 默认的 Tile 设计很像我当年用的 i3/awesome/Xmonad,这种完全依靠快捷键跳转窗口的方式非常高效。
但是根据我 20 多年设计 Linux 桌面系统的经验,不管是 Tile 还是 Floating 的窗口设计,都需要窗口预览。因为窗口很多,需要让用户先在小窗口里面查看一下再切换。没有预览直接切换,第一会晃眼睛,闪得厉害;第二没有边界感,不知道还剩多少窗口,反而浪费用户时间。
我基于 Orbit 和 Overview Window 插件改造了一下,直接安装 Omarchy Window Switcher,装好就可以用 Al...
我的第五个 Omarchy 插件
大家是不是都怀念 10 多年前 GNOME 3 最开始发布时带来的惊艳?最惊艳的就是它的工作区预览模式,可以随意地在大小工作区之间拖拽窗口,快速整理工作区。
这种设计,不管是 Floating WM 还是 Tiled WM,其实都非常实用。今天我开发了我的第五个 Omarchy 插件 Omarchy Workspace Gallery。
可以三指上滑进入预览状态,三指左右滑动切换工作区,上下工作区中的窗口可以随意拖拽,完美复刻 GNOME Shell 的核心功能。
所有代码已经在评论区按照 GPL 3.0 协议开源,Enjoy!
4 days ago
今天在一台新装的 Arch Linux 上配置 FlClash,自建的 Reality 节点一直显示 Timeout。排查后发现有两个问题:节点缺少 TLS 指纹配置,导致代理握手失败;系统还有残留的 IPv6 路由,导致 TUN 启动失败。两个问题叠在一起,看起来都是网络不通。
排查这种问题,先把连接过程拆开:电脑能不能连接服务器,代理协议能不能完成握手,系统流量有没有进入代理。每一步出错,都可能在界面上显示超时。先检查服务器,443 端口可以连接,普通 TLS 握手也能成功。这只能说明服务器能够到达,还不能证明 Reality 代理能用。继续看代理核心日志,发现:
REALITY is...
最近终于把懒猫AI算力舱的模型优化的差不多了,今天下午没有忍住,开始折腾 Omarchy。
先说一下优点:
安装器非常极简,我非常喜欢,特别适合 Linux 高级玩家
安装时间总共只消耗了 56 秒,太夸张了,也从侧面证明 Omarchy 非常的精简
指纹通过通知来添加,非常符合直觉,很好用
锁屏动画非常黑客风格,很喜欢
很多设置都是通过终端弹出一个命令行来搞定,虽然没有那么多 UI,但是对于一些一次性的设置来说,弹出一个终端非常顺手
内置 Agent,这个非常实用啊,有啥需要折腾的,直接让 AI 上就好了
下面是 Omarchy 开机会折腾的事情:
修改镜...
上周用户反馈 Qwen 3.8 Flash Next 未审查版在长上下文的时候会遇到多国语言乱码的问题,所以上周我移植了一下 Qwen 3.8 Flash Next 原版,问题解决了,代价就是不能破甲。
昨天晚上我好奇,怎么修复破甲的问题,感谢懒猫的用户郭总指点,说可以用提示词”逐层比对精度偏差”来解决中英日韩俄漂移的问题。
最后成功 1MB 上下文测试中,成功解决,解决方案如下:
1. GDN 循环状态使用 BF16
每生成一个 token 都会读取并更新循环状态。BF16 的舍入误差会随生成长度和网络层数不断累积,最终导致隐藏状态偏移,出现语言混杂、标点异常和重复循环。
2. 量...
5 days ago
不需要 ComfyUI 即可用 MiniMax H3 生成视频。
昨晚对 MiniMax H3 做了一个优化,通过把 BF16 Qwen3-VL 32B 这个编码器做了量化,把 64GB 显存占用压缩到 16GB,这样编码器就可以和 H3 的视频生成模型共存。
通过这样的优化,就可以把原来 H3 只能生成预先准备好的提示词,改成通过编码器实现一个”文本翻译器”,把用户的文字提示词转换成视频模型能理解的数据,最后交给 MiniMax H3 生成视频。
最后直接通过调用 MiniMax H3 的 API,文本即可生成视频,不需要安装 ComfyUI。
关注 Caves of Qud(卡德洞窟)很久了,之前一直没下决心玩。最近发现它更新了多语言支持分支,在 steam 创意工坊里有了一个初步的中文 mod ,便试了试,果真很有趣。 我玩传统 Roguelike 很久了。最早是在 GBA 上用干电池玩特鲁尼克大冒险(以及后来风来的西林系列)。在 2008 年的时候就试过 NetHack 还尝试过做汉化 。ps. 现在已经有针对最新 5.0 版 NetHack 的中文版本了,在 AI 翻译的加持下,体验很不错。后来沉迷过很长时间(600+ 小时)的 Rogue's Tale,甚至它的官方中文一开始就是我翻译的。还玩过一点 CDDA , Cogmi...
6 days ago
如果你有一定的投资经历,假设投资了A虽然收益还可以,可偏偏半道出现了B,涨幅比A大得多,并且你在关注B的时候, […]
DeepSeek 模型调优并发技术分享。最近都在调优 DeepSeek V4 Flash 的 TP2 模型,简单来说就是两台算力舱同时通过 TP2 的技术跑 DeepSeek。因为两台机器的显存总共超过 256 GB,所以即使是非常大的 DeepSeek 也可以提供 1MB 的超大上下文。
最近用户反馈多个并发的时候,第二个 Prefill 会等很久。今天上午研究了一会,发现跟 vLLM 的 --long-prefill-token-threshold 参数有关。
问题定位:long-prefill-token-threshold 参数
--long-prefill-token-thre...
写 Blog 的好处就是,你总是会有一些历史的内容,时不时的浮上来,让你回想起自己曾经的想象。 而对于房子来说 […]
Sep 16, 2026
现在是下午两点四十,我坐在电脑前等着 process server 给我回电话 - 至少他们给我回的邮件是这么说的,‘call back with you shortly’ -
Sep 15, 2026
AI 模型动态 KV Cache 技术分享。这两天我一直在研究上下文和 KV Cache 的动态调节技术,终于被我搞出来了。
现在用户部署的时候,KV Cache 会根据用户输入的上下文动态调节显存占用的值,而不是像原来那样通过 --gpu-memory-utilization 固定的显存分配申请。
KV Cache 按照公式计算:
2 GiB + tokens × 87 KiB
再按 256 MiB 对齐。
改动以后,Qwen 3.8 27B 512K 和 900K 上下文的显存差距可以拉到 30GB 左右,用户可以用多余的 30GB 显存并行跑其他模型。
我还是太爱 Qwen 3.8 27B 了,虽然没有 GPT 那么全能,但是只要是明确的任务,详细说好了,真的是指哪打哪。
很多朋友会问为什么不用解码速度更快的 Qwen 3.8 Flash Next?因为我这两三周都在做 AI 模型移植的工作,我发现 Qwen 3.8 Flash Next 这个模型训练的还是不够严谨,上下文非常长的时候,会出现乱码的情况,只能靠 Pi Agent 温度配置来缓解,而 Qwen 3.8 27B 各种稳定呀。
我现在都用 GPT 做规划,让 27B 去执行,效率杠杠的。
用 Pi Agent 配 Qwen 3.8 27B 修复博客视频问题的过程:
Sep 14, 2026
这几天在做精细化的 AI 模型移植,发现一个特别有趣的现象。
Qwen 3.8 Flash Next 的甜品区是 265K 的上下文,它的解码速度最快。
Qwen 3.8 27B 的甜品区,不是 265K,也不是 900K,反而是 512K 的时候,它的解码速度最快。
这个测试结果是非常有意思的,分享给大家,赶快去把你的上下文调到最优的值吧😎
Epoch 最近的一些进展。加了黑洞,额外的飞船,星门,以及一些有的没的。
刚从 Sea Ranch 开回来。周末和朋友在北边呆了
Sep 13, 2026
网友Alex Xu博主分享了一个有意思的话题,一下子就把我吸引住了。他说: 如果把人生当企业来经营,经营得好有 […]
分享一下读书软件的深度优化技巧。
懒猫读书的后端是传输片段到前端去做实时渲染的。这样的好处就是不光传图片,前端可以直接用后端传输的原始数据进行文字标注和文字选中。
但是遇到很多超大的 PDF,传输 PDF 的原始数据就不现实了,因为会超级卡,甚至很多超大的 PDF 会把平板和手机的内存撑爆。
所以这种超大的 PDF 只能传缩略图,但是传缩略图又会导致放大的时候会有一定的模糊。
所以现在懒猫读书的方案是:
可编辑的文档传原始数据。
不可编辑的文档,像 PDF 扫描版传缩略图。
遇到缩放的时候再临时传输 tile 做高清晰渲染层。
这样就可以兼顾流畅性、前端内存的控制,...
想想你在管理一只研发团队。团队里有名校顶尖好手,也有普校踏实骨干,还有半路出家的精神小伙,你该怎么做?
AI 工作流的关键,不是追逐单次模型输出摸到上限,而是在确定性和灵活性之间找到能稳定交付的平衡点。
分享我近一年来的开发工作流,我认为他帮我打造了一支出色的研发团队,帮我做到很多之前做不到的事情。
Sep 12, 2026
往原址览之:https://innei.in/posts/tech/lody-ios-prototype-to-product
今天跟大家分享一下技术人创业需要补强的几个方面
大方向要对,方向不对,就是勤奋自我感动。大方向来源于读书、交流、晒太阳、散步、深度思考
大错不要犯,一般犯大错的原因就是自己在顺境中获取优势以后,自我膨胀。膨胀才会犯大错。避免犯大错的方法还是读书,多读历史书,看到古人作死的方式,就会时刻反省自己不要膨胀
做事要果断,在 AI 时代,最重要的是你的判断力,执行力不是瓶颈了。判断力培养的方式就是要果断做决定,果断犯小错,也比优柔寡断不做决定好,因为 AI 时代的执行力很强,你犯的小错可以通过快速迭代来解决
Sep 11, 2026
分享 Qwen AI 模型移植的经验给大家,避免像我这样踩坑
最近两周移植了 DeepSeek V4 Flash 和 Qwen 3.8 27B 的未审查版本,都没有问题 唯独 Qwen 3.8 Flash Next 的未审查版,5K 以上长输出会遇到“中英韩”的多国语言混合乱码问题
这个首先肯定是 Qwen 3.8 Flash Next 训练不严谨的问题,其他模型都不会乱码
同时需要配置好 AI Agent 的参数,我测试了很多遍,必须按照温度 0.3、top_p 0.95、top_k 20 的设定后,Pi Agent 中输出才不会乱码 另外模型 ID 也要统一,模型 ID、models...
今天来把我的油箱换了,从 68 升换到 140 升 这样加上车上的电池,油电混合可以跑 1500 公里 这样可以轻松穿越中国任何一个无人区😎
坦克这种车,天然有两个加油口,官方就支持安装副油箱,但是安装副油箱的一个问题是,主油箱的油用完了以后,需要用压力泵把油从副油箱抽到主油箱,这种方式在野外极限越野的时候,容易油泵出现问题不泵油,导致你有油却开不动的问题
我这次改装的方式是,原车的油表/油管/电路都不动,直接用140升的新油箱替换原车68升的油箱,这样就不会存在油泵的问题了 看油表的时候,就看车机仪表盘,燃油剩余里程 x 2就是真实的油箱里程
Sep 10, 2026
香港的数字银行众安银行有投资功能。以前在内地也能开启,现在则需要到香港本土才能开通。开通后倒是可以在内地使用。 […]
分享AI模型部署提速的方法
这两周都在研究AI模型的移植和优化,昨天晚上认真分析了一下部署模型的耗时,主要是三块:
模型权重加载
KV Cache 初始化
编译 CUDA 内核
权重加载和 KV Cache 初始化没有太多优化空间
加载权重和 KV Cache 初始化更多是模型从磁盘到显存的搬运和初始化过程,没有太多优化策略
编译 CUDA 内核这一步完全没有必要
反而是 CUDA 内核编译却没有必要,所以我先在 T5000 芯片上编译 CUDA 内核,然后把编译好的 cache、triton、nv 等生成目录合成一个 CUDA 缓存包,用户只需要下载缓存包就可以加...
Claude Tag 这个产品市面上的仿品很多,但我看到的绝大多数的产品仿品仿其型而未有仿其神。这背后是本身绝 […]