SHANYE / LLM ARCHITECTURE
让模型在被提问之前,就已经在感知。
关注注意力架构、长期自我状态,以及 agent 在没有指令时如何继续运转。
SHANYE / LLM ARCHITECTURE
关注注意力架构、长期自我状态,以及 agent 在没有指令时如何继续运转。
我是山野,一名兴趣驱动的研究者,喜欢在少人关注的领域进行默默探索。长期工作在两个相邻方向:让模型的注意力更接近环境感知,让 agent 在无人提问时也持续存在。
查看精选项目让 agent 在没有人提问时,自己决定今天该做什么。这条路还没被走通。
10
四个项目,围绕同一个问题:模型在没有指令的时候,能不能自己继续运转。
01 / 自主系统 · 架构研究
一个会改写自己架构的 agent:它在运行中修改自己的组织结构与执行路径,而不是等外部指令告诉它下一步做什么。
意图向量跨时间步持续存在,自改写回环让执行路径可以被重新排列。
每一轮改写都留下版本,历史可回滚,失败可复盘。02 / 注意力机制 · 算子研究
把注意力从二维相似度改写成三维几何上的路由与聚合:先在位置层面做一次全局检索,再做通道内归并。
路由密度降到 P = 4 时,复制类任务退化 11 个百分点。
五轮排除分别指向任务几何、位置信息与路由密度。03 / 涌现系统 · 原型
8 万个 LIF 神经元与 STDP 突触可塑性搭出的环境:意识不被编程,而是从交互里长出来。
SHA-256 锚定配合六种本能的轮转,让行为从环境里长出来。
八个神经集群、六种本能、六个基础情绪作为 DNA 层的先验。04 / 实证 · 自主能力
在 ProgramBench 的挑战里,agent 从零写出一个可用的 SQLite:9 个源文件、约 70KB,30 项 oracle 测试全部通过。
从零编译通过、并跑完全部测试的数据库引擎。
覆盖 DDL、DML、WHERE、ORDER BY、LIMIT、聚合与 dot command 的边界用例。如果项目正处在假设不清、实验不可信、或者系统根本跑不起来的阶段,可以从这里开始聊。
我的工作覆盖四个环节:提出可证伪的假设、用实验排除、落成系统、写成能被审稿人重新推导的论文。
先把问题写成一句可以被推翻的话:什么结果会让我放弃它。没有这一条,后面的实验都只是自我确认。
在宣布“这就是天花板”之前,先用五轮排除把它问遍:调参、数据、架构、任务几何,最后才轮得到结论。
研究结论要能跑起来才算数:从向量化算子、多服务后端到验收复盘,每一步都留下可以检查的产物。
按审稿人的标准先被打一遍:多模型交叉评审、引用与数字溯源、重复率核验,把问题挡在投稿之前。
我更关心模型能不能在没有人提问的时候,也知道“自己是谁、环境在变”。
如何开始一个项目先确认问题本身是否可证伪,再看现有方案到底卡在哪一步——是能力不够,还是问题问错了。
如何推进合作每一步都留下可检查的产物:假设写下来,实验能复现,系统跑得起来,结论能被别人重新推导。
目前同时推进四条研究线,还有一些散点的兴趣。站内案例经过简化,重点保留问题、方法与关键决策。
把问题写成可证伪的假设
用五轮排除把错误问遍
让结论落成能跑的系统
写成别人能重新推导的论文
内容会先在你的浏览器里加密再送出,只有我能读到明文。
收到了,会在邮箱里看。内容在离开你的浏览器之前就已加密,只有我能读到明文。