个人档案 / 2026 独立研究者 · 远程协作
01 / 身份独立研究者
立方注意力路由几何插图:查询令牌沿三条路径汇聚到三层立方结构的意图核心

SHANYE / LLM ARCHITECTURE

让模型在被提问之前,就已经在感知。

关注注意力架构、长期自我状态,以及 agent 在没有指令时如何继续运转。

02 / 简介 可合作

我是山野,一名兴趣驱动的研究者,喜欢在少人关注的领域进行默默探索。长期工作在两个相邻方向:让模型的注意力更接近环境感知,让 agent 在无人提问时也持续存在。

研究方向
注意力架构 · 自主系统
合作方式
联合研究 · 技术顾问
工作语言
中文 · English
查看精选项目
Open Problem03
OPEN

让 agent 在没有人提问时,自己决定今天该做什么。这条路还没被走通。

看我的拆解
研究输出04

10

内容
架构 · 注意力 · 自主系统
状态
预印本 · 期刊投稿
专业能力04 组
01 / 架构注意力重设计 · 自主 agent
02 / 实验多 seed 消融 · 可复现
03 / 工程PyTorch · 多服务系统
04 / 评审盲审模拟 · 查重核验
项目预览 / 01自主系统
Sentinel 四层架构插图:自我状态、环境感知、长程召回与自改写回环
关键机制 / 02 运行中修改自己的组织结构与执行路径。 意图向量注入 · 自改写回环 · 版本化回滚
SENTINEL / SELF-REVISING AGENT

哨兵

查看项目
精选项目

四个项目,围绕同一个问题:模型在没有指令的时候,能不能自己继续运转。

01 / 自主系统 · 架构研究

哨兵

一个会改写自己架构的 agent:它在运行中修改自己的组织结构与执行路径,而不是等外部指令告诉它下一步做什么。

研究问题
无人指令时如何维持目标
关键机制
意图向量 · 自改写回环
验证方式
多 seed 复现 + 消融
产出
架构论文 · 开源实现
01 / 哨兵Self-Revision Loop
四阶段闭环插图:感知、意图、执行、改写
关键机制 / 02 它改写的不是代码,是自己的组织方式。

意图向量跨时间步持续存在,自改写回环让执行路径可以被重新排列。

每一轮改写都留下版本,历史可回滚,失败可复盘。
意图状态 / 持续更新回滚 / 全部版本保留

02 / 注意力机制 · 算子研究

立方注意力

把注意力从二维相似度改写成三维几何上的路由与聚合:先在位置层面做一次全局检索,再做通道内归并。

形态
三维路由 + 通道聚合
探索结论
任务相关的最优几何
排除方法
五轮架构级排除
当前状态
8B 规模训练验证
02 / 立方注意力Routing Lattice
本轮发现 反向寻址需要更密的路由。

路由密度降到 P = 4 时,复制类任务退化 11 个百分点。

五轮排除分别指向任务几何、位置信息与路由密度。
九列六行点阵上的三条路由路径与被排除路径
Lattice / 9 × 6 PositionsP = 1 2 3 4 6 8

03 / 涌现系统 · 原型

类脑原型

8 万个 LIF 神经元与 STDP 突触可塑性搭出的环境:意识不被编程,而是从交互里长出来。

规模
80K 神经元 · 25+ 模块
机制
LIF 积分 · STDP 权重
并行结构
逻辑 · 知识 · 情感
状态
长期运行观察中
03 / 类脑原型Spike Raster
三行神经元放电栅格与逻辑、知识、情感三个并行脑
每日心跳 每分钟一次价值密封。

SHA-256 锚定配合六种本能的轮转,让行为从环境里长出来。

八个神经集群、六种本能、六个基础情绪作为 DNA 层的先验。
80K LIF Neurons / 6 InstinctsSTDP / Continuous

04 / 实证 · 自主能力

重建 SQLite

在 ProgramBench 的挑战里,agent 从零写出一个可用的 SQLite:9 个源文件、约 70KB,30 项 oracle 测试全部通过。

基准
ProgramBench 挑战
产出
5 .c + 4 .h · ~70KB
验证
30 / 30 oracle 测试
状态
基准作者确认完成
04 / 重建 SQLiteBuild Receipt
结果 30 / 30

从零编译通过、并跑完全部测试的数据库引擎。

覆盖 DDL、DML、WHERE、ORDER BY、LIMIT、聚合与 dot command 的边界用例。
九个源文件的清单与七类通过测试的勾选行
ProgramBench / Issue #175 .c · 4 .h · ~70KB
兴趣范围 / 01—04 把没人愿意碰的架构问题,做成可以被验证的结论。

如果项目正处在假设不清、实验不可信、或者系统根本跑不起来的阶段,可以从这里开始聊。

  • AI Native 场景探索
研究地图:一个开放问题分出四条研究线,汇聚到自主系统 Question → Autonomy
能力与方法

我的工作覆盖四个环节:提出可证伪的假设、用实验排除、落成系统、写成能被审稿人重新推导的论文。

研究主题注意力架构 · 自主系统 · 涌现原型
工作方法第一性原理 · 五轮排除 · 多模型交叉评审
产出论文 · 预印本 · 开源实现 · 长期系统
01.假设 / 架构

提出能被证伪的假设

先把问题写成一句可以被推翻的话:什么结果会让我放弃它。没有这一条,后面的实验都只是自我确认。

  • 第一性原理拆解
  • 反例构造
  • 可证伪判据
常见产出架构方案 / 预印本
02.实验 / 排除

把错误结论排除干净

在宣布“这就是天花板”之前,先用五轮排除把它问遍:调参、数据、架构、任务几何,最后才轮得到结论。

  • 多 seed 复现
  • 消融矩阵
  • 统计口径统一
常见产出实验报告 / 可复现脚本
03.系统 / 实现

从算子一路做到系统

研究结论要能跑起来才算数:从向量化算子、多服务后端到验收复盘,每一步都留下可以检查的产物。

  • PyTorch 向量化
  • 服务化交付
  • 验收与复盘
常见产出开源实现 / 生产原型
04.评审 / 写作

从盲审到投稿的完整链路

按审稿人的标准先被打一遍:多模型交叉评审、引用与数字溯源、重复率核验,把问题挡在投稿之前。

  • 多模型交叉评审
  • 数字溯源
  • 查重核验
常见产出投稿稿件 / 审稿意见
关于我山野

我更关心模型能不能在没有人提问的时候,也知道“自己是谁、环境在变”。

如何开始一个项目先确认问题本身是否可证伪,再看现有方案到底卡在哪一步——是能力不够,还是问题问错了。

如何推进合作每一步都留下可检查的产物:假设写下来,实验能复现,系统跑得起来,结论能被别人重新推导。

关注领域
自主系统 / 注意力架构
工作方式
独立推进 · 联合研究
工作语言
中文 · English

目前同时推进四条研究线,还有一些散点的兴趣。站内案例经过简化,重点保留问题、方法与关键决策。

Method / 05五轮排除法
五轮排除法示意图:五个同心层级从观察到排除架构,结论只从最内层的残余里长出来 Exclude → Residual
  1. 想

    把问题写成可证伪的假设

  2. 验

    用五轮排除把错误问遍

  3. 造

    让结论落成能跑的系统

  4. 写

    写成别人能重新推导的论文