zhilinOfficial

zhilinOfficial

项目展示

独立研究项目 · 神经科学 × 工程

残差触发数据采集

常开相机一天产生约 270 GB 原始视频,但真正有价值的片段常常不到 3%。 检测"什么重要"很难,预测"什么变化是自己造成的"很容易——因为设备自带 IMU。 这个项目把小脑/电鱼的「伴随放电 → 负像学习 → 残差上报」三元件电路搬进相机数据通路: 用陀螺仪副本预测自运动引起的视流并减掉,残差大的片段才触发存储。 零训练、零标注、0.17 ms/帧。

  • 小脑启发
  • 具身智能数据采集
  • IMU 副本
  • 在线自适应
  • 零训练零标注
  • 可证伪实验

Headline Numbers

核心数字(全部实测)

3.4%合成 rig 上触发器的存储占比——用 1/15 的存储打赢均匀采样 4 倍预算
0.171 ms/帧像素管线成本,仅占 30 fps 帧预算的 0.5%,便宜到可以 always-on
0.298残差选中片段训练下游模型的 val AP(uniform 4x 预算仅 0.145)
0.96事件召回 evRec@10,超过全预算 oracle(0.72)——且保留上下文

范围声明:下游价值结论成立在合成 regime;真实 egocentric 数据上"运动不可预测 ≠ 语义重要性"已被 10 段 250 轮实验钉死(见下文"边界")。负结果和正结果一样,都是这个项目的产出。

Interactive Demo

残差触发模拟器

一个可玩的合成场景:灰色网格世界里,相机自己在随机转动(你也可以按住画面左右拖动来模拟手持晃动),偶尔有新物体出现(ground-truth 事件)。下面两条曲线分别记录"朴素帧差"和"陀螺仪补偿后的残差"的 z 分数。朴素帧差被自己的运动淹没;补偿后的残差只在真正的事件处越过阈值——这就是整套方法成立的核心机制。

Cerebellum 存储占比
z 分数触发,自适应
Naive 帧差 存储占比
同样自适应阈值,无补偿
事件召回(Cerebellum)
事件帧中被存下的比例
事件召回(Naive)
对照组
朴素帧差 z(被自运动淹没) 陀螺补偿残差 z(只在事件处开火) 触发阈值 ground-truth 事件区间

教学模拟:预测器在这个玩具世界里享有"合成 rig 特权"——运动恰好是纯旋转、副本恰好精确。真实数据上副本会退化、运动含平移与视差,此时残差质量优势不再兑现——这正是项目花 15 个实验去丈量的东西。

Method

方法:伴随放电 → 负像 → 残差

01

副本

Corollary Discharge

读陀螺仪,知道相机此刻在怎么转。电鱼为这份副本进化了一整套神经结构,手机出厂就有。获取成本 0.032 ms/帧。

02

负像

Negative Image

在深度特征图(MobileNetV3 [:3],24×28×28)上维护逐格运行统计,学出"自己运动通常造成多大的变化"——在线、无标注、无时钟、可 winsorized。

03

残差触发

Residual Report

把预测到的部分 warp 减掉,残差 z 分数大的片段才触发存储。存的是"设备自己预测不了"的画面——运动去重 + 带宽预筛。

对照生物学:非洲弱电鱼用同款三元件电路,把自己比猎物信号强几个数量级的自发电干扰从感受器输出里减掉(Perks et al., Nature 2026,connectome 重建 29,694 个突触证实)。

Cost Profile

成本账:副本的代价是 30 微秒

gyro shift(24×28×28 特征图)
0.032 ms
像素管线核心(warp+网格+可塑性+触发)
0.171 ms
冻结 backbone 前向(MobileNetV3 [:3])
0.83 ms
DIS 稠密光流(320×240)
3.81 ms
完整 flow-cancel 步
4.46 ms
0.03 ms对数刻度 →4.5 ms(30fps 帧预算的 13%)

读法:「用感觉补偿感觉」(光流)比 IMU 副本贵约 120 倍,且依赖纹理、怕大位移;常开约束下不可接受。光流的真实位置是质量上限与按需仲裁者,不是常开预测器。CPU vs MPS 特征逐位一致(最大相对差 2e-6),CPU 仅慢 1.7 倍。

Downstream Value

存储-价值对比:合成 rig 下游训练

冻结特征 + 帧级事件分类(logistic 头)。条形为 val AP;括注为存储占比。残差触发(黑条)用 3.4% 的存储拿到最高 AP,并超过全预算 oracle 的事件召回。

cerebellum自适应触发
0.298 · 3.4%
uniform 0.5x半数字节
0.126 · 7.9%
uniform 1x基准预算
0.127 · 15.0%
uniform 2x双倍预算
0.113 · 30.1%
uniform 4x四倍预算
0.145 · 51.0%
oracle预算全花在事件帧
0.191 · 1.9%
0val AP0.3

为什么 cerebellum 能打赢存储更少的 oracle:oracle 只存事件帧,丢掉了上下文;残差触发保留事件前后的背景,下游模型因此学得更好。这是「保留上下文」价值的直接证据。

Experiment Ledger

15 个实验的诚实台账

项目的原则:论文的每条启发对应一个可独立复现的实验,正结果和负结果都记录在案。✅ 成立 · ⚠️ 部分成立 · ❌ 实测不成立 · ⬜ 未验证

#实验核心数字状态
1合成下游训练对比(headline)3.4% 存储 → AP 0.298 / evRec 0.96;uniform 4x 预算 AP 0.145;oracle(1.9%)AP 0.191✅ 成立
2成本画像gyro 0.032 ms vs DIS 光流 3.8 ms,~120 倍差✅ 成立
3分辨率扫描(合成 224/336/448)gyro 收益 −41%/−52%/−58%,单调未饱和✅ 成立
4光流上限与 RAFT 对照DIS 0.1056 ≈ RAFT 0.1054;RAFT 慢 ~20 倍✅ 成立
5CPU/MPS 可移植性特征最大相对差 2e-6;CPU 仅慢 1.7 倍✅ 成立
6真实桌面 12 段触发stored 中位 9.2%、recall 0.46;自运动亚像素,gyro warp 物理中性⚠️ 部分成立
7高运动真实对gyro warp 比 naive 差;DIS 光流质量胜、成本败 250 倍⚠️ 部分成立
8448px 真实交叉合成设计规则不迁移:gyro 仍帮倒忙(+15%),光流逐段翻转❌ 不成立
9平移建模(常深度)gyro+trans 0.0938 vs 纯旋转 0.0901——模型类错误❌ 不成立
10真实数据下游价值(9 类动词,105 轮/方法)cerebellum 0.162 ≈ uniform 0.173 ≈ oracle 0.164,全部 1σ 重合❌ 不成立
11稀疏物理事件 regime(10 段,250 轮/方法)主场假设确认不成立:cerebellum ≈ uniform,oracle 优势收窄❌ 不成立
12z 图读出端升级zamp 三种存储方法 AP 逐位相同——残差图零事件信号❌ 不成立
13行走级 4 段 gyro 价值gyro 比 naive 差 3/4 段——"运动越大副本越值钱"证伪❌ 不成立
14光流仲裁级联机制与成本验证(摊销 0.15–0.9 ms/帧),价值待兑现⚠️ 部分成立
15iPhone 真 gyro 通路未验证——真机 IMU 是"检验行走级结论能否翻转"的实验⬜ 未验证

Idea Lineage

思想谱系:感知 = 预测 + 残差

1867

Helmholtz — 无意识推理

知觉不是感觉的被动记录,而是结合先验的推断。

1950

von Holst & Mittelstaedt — 伴随放电

区分"再传入"(自己动作造成的感觉)与"外传入"(环境造成的感觉):神经系统持有动作指令的副本。

1970s

Marr–Albus–Ito — 小脑是监督学习机器

爬行纤维携带误差信号,修正平行纤维-浦肯野细胞突触——局部可塑性实现误差驱动学习。

1980s–90s

Kawato / Wolpert — 内部前向模型

小脑承载"给定指令,预测感觉结果"的前向模型:运动控制、感觉衰减、眼动抑制由此统一。

1999

Rao & Ballard — Predictive Coding

视觉皮层的兴奋模式与"自上而下预测 + 自下而上误差"的分层推断一致。

1990s–2000s

Bell & Bastian — 电鱼负像

ELL 的 negative image 是上述思想最干净的可电生理验证实例。

2026

Perks et al.(Nature)— connectome 约束

整套计算不是隐喻:29,694 个突触的重建证明"副本 + 局部可塑性"靠精确电路结构(双可塑性位点、recurrent 加速)实现快、准、抗噪——本项目的直接起点。

Honest Boundaries

边界:负结果划清的适用域

「运动不可预测 ≠ 语义重要性」 实测证伪 · 250 轮

在真实 egocentric 数据上,残差选的是"运动上不可预测的帧"——快速手部运动和运动模糊——而不是"语义上重要的帧"(残差峰与动作标注反相关,AUC 0.47)。稠密语义任务的采集筛选必须靠视觉模型侧的其他信号。

「主场 regime 也没赢」 实测证伪 · 250 轮

即使在稀疏物理事件(跌落、扔掷)这个本该最赢的 regime,cerebellum 与 uniform 采样打平(AP 0.108 vs 0.104);且追测用真值平移排除了"自运动没分离干净"的归因——残差噪声是世界运动,谁都解释不掉。

「残差图本身不携带事件信息」 读出端关闭

升级读出(幅度/空间金字塔/拼接 backbone)后,z 图幅度与空间模式都不携带事件判别信息——三种存储方法下 AP 逐位相同(逻辑回归在零信号上学到零权重)。预测、建模、读出三个方向的出口全部关闭。

「运动越大副本越值钱」 行走级证伪

行走级 4 段(gyro p95 71–75°/s)中 gyro warp 在 3/4 段比不补偿更差:运动越大,模型类误差(平移/视差/滚动快门)和 SLAM 副本退化越严重。真实数据上 gyro warp 从未赢过 naive。

协议层的正确定位 收敛结论

残差触发器是「运动不可预测性的滤波器」。成立的资产:①合成 regime 的下游价值;②跨 regime 成立的成本账(IMU 副本比光流便宜 2 个数量级);③边界知识。它该接在运动去重 / 带宽预筛 / 合成 rig 采集筛选的位置——语义重要性仲裁必须发生在视觉模型侧。负结果不是死路,是协议设计的边界知识。

下一步:仲裁级联的真实失效模式验证(roll/视差/标定误差)、ON/OFF 对抗通道与 recurrent 加速补全、iPhone 真机 IMU 检验行走级结论、加速器友好化(全部算子都是平移 + EMA)。