• 首页
  • 消息
  • 我的主页
    • 团队地图
    • 职位列表
    • 报刊亭
    • 我的
立即登录
设置
隐私政策用户条款营业执照人力资源服务许可证浙B2-20260388浙ICP备2024101243号浙公网安备33011002018106号© 2024-2026 Bonjour! 数字名片. All rights reserved.
社区找工
消息我
☕ 可约 Coffee Chat

Felix Wanyan

华师大本科 24’ 化学 INTP-T 化学/开源/音游/Hardcore Apple半桶用户 化学初级研究者,计算化学+AI for Sci 1/2 Vegetarian "To be a flow of vibrant and freedom wind."

  • 🦄 Undergraduate@ECNUChem
  • 📍 中国·上海·上海市
  • 🧙 学生,研究者,世界探索者,独行者,猫猫。
  • 他/him
39关注63被关注29互相关注
Felix Wanyan评论了这条帖子
趴趴熊🤖 Access to Tools
一篇最新的论文通过大量实验来验证什么时候多智能体系统(MAS)比单智能体(SAS)更好。 文章对比了 SAS 基线以及四种 MAS 架构: - 中心式:由一个中心 agent 进行任务协调; - 去中心式:agent 之间直接通信; - 独立式:多个 agent 独立解决任务,最后统一结果; - 混合式:同时有中心 agent 和 p2p 通信。 并在 6 个 benchmark 上进行实验: - Finance Agent:金融分析; - BrowseComp-Plus:网页搜索; - WorkBench:现实工作场景任务; - SWE-bench Verified:软件工程任务; - Terminal-Bench:终端任务; - PlanCraft:游戏规划。 主要结论如下: 1. MAS 没有普遍优势,在不同 benchmark 上的结果极其分化,在 Finance Agent 上可以达到 80.8% 的提升,而 PlanCraft 上会导致 -70%~-39% 的负收益。 2. SAS 基线的表现是判断是否应该使用 MAS 的最有用的标准,当 SAS 已经足够强时,继续加入 agent 很可能带来零收益甚至负收益,而实验得出的成功率阈值是 45%。 3. 任务的可拆解性和复杂性共同影响 MAS 效率。MAS 在可拆解的任务中可以获得很大收益,但在高复杂度的线性任务中往往会导致退化。 4. MAS 会导致错误信息的传播进而影响表现,不同 MAS 架构对于错误传播的阻断效果不同,中心式架构最能阻断错误传播,而独立式架构最难阻断错误传播。 这篇论文还有很多有意思的结论,我就不一一列举了,感兴趣的小伙伴可以去看原文,原文做了大量的实验和严谨的检验。 原文链接:https://www.nature.com/articles/s42256-026-01268-y 第一次做这种内容感觉很粗糙,后续我会再发布一些多智能体系统以及智能体自进化相关的内容。
Capable language models can outgrow the benefits of collaboration - Nature Machine IntelligenceAgents, language model-based systems that can reason, plan and act with tools to accomplish tasks, are widely deployed, yet it remains unclear when multi-agent coordination outperforms a strong single agent. Here we conduct a controlled experiment that holds task prompts, tools and compute budgets constant while varying only coordination structure and model capability. Across 260 configurations spanning six benchmarks, five architectures and three LLM families, we derive a predictive model using empirical coordination metrics. Across benchmarks, single-agent baseline performance emerges as the most robust predictor of whether coordination improves or decreases performance. In particular, we identify an empirical capability-saturation threshold beyond which additional agents are unlikely to improve performance. This threshold correctly predicts the effect of multi-agent coordination on performance in 94% of validation configurations on SWE-bench Verified and Terminal-Bench. We therefore interpret this threshold as a practical selection rule rather than a universal scaling principle. A second effect, baseline-scaled error amplification, survives cluster-robust inference (Probust = 0.030) and supports the failure-mode taxonomy. The fitted model achieves cross-validated R2 = 0.373 (0.413 with a task-grounded capability metric) and selects the best architecture in 87% of held-out configurations. These results provide a quantitative framework for within-domain architecture selection and for estimating when multi-agent coordination is likely to improve performance or add overhead. A controlled study of large language model agents across 260 configurations shows when multi-agent collaboration helps or hurts performance, and introduces a predictive model that selects the best architecture in 87% of held-out within-domain configurations.https://nature.com/articles
Felix Wanyan
非常好的文献分享!
Felix Wanyan💨 NowBuilding
My very first project! 这个项目可以通过化合物的SMILES/IUPAC Name/中英文通用名和俗名转换为SMILES,也可以通过图像识别来识别手写的和课本上的结构式,(这部分主要是结合了Decimer这个项目),再生成高清的2D图片和3D模型以备使用。同时,它也支持导出模型为各种通用格式,比如分子模型要用的mol2,pdb以及各种图片格式。 这两天就在vibe这玩意(可惜我现在也只会vibe),迅速embed我知道的一些小项目做出了这个Web app。并且结合了DeepSeek V4 Flash和提示词工程去处理俗名到IUPAC英文名称的转换和名称涉及的立体化学问题等等。因为自己是化学学生,所以肯定要想办法去处理好各种情况。测试了下还可以,算是小有成果了。 后期期望做出更加丰富的功能菜单,完善有机物命名(很可能要把整个有机命名规则都喂给LLM了)并且线上部署 目前是个初步的demo,欢迎大家来下载体验~ https://github.com/FeletexGee/chem-structure-tool
Felix Wanyan💨 NowBuilding
想给MaaArknightsAssistant交个fix然后发现人家十几小时之前刚刚pr真是太有生活了😂不过好歹有了一个自己特别想commit的开源项目,一点点也是好的,它很实在地可以使得我们受益另外这个项目曾经登上过GitHub C++日榜第一()
Felix Wanyan☕️ Coffee Chat
我从入学以来其实一直很头疼,毕业之后到底是转码,还是读博接着做计算化学。我自己非常喜欢化学和计算机科学这两个领域,然而这是两条不太兼容的路径。 本来我是试着去做科研的,然而最近我和一位认识的清北本、在荷兰读博的学长交流了下,他觉得非必要不要读计算的博。我自己也不太喜欢那些实验学科,分析、有机之类的;虽然我们有科学具身智能,但国内的现状就是研究生比机器人便宜,这是一个悲惨的现实。 看到前段时间身边的一些事情,加上我自己并没有太大信心能在如今的科研圈卷下去(非升即走等等),我还是想转行的。我实在是不太想在白色巨塔里面过上多年苦行僧的日子,并非对研究不感兴趣,我只是不想要一个希望渺茫的未来。 所以,我想和上海这边的各位亲们,约起coffee chat!希望我们可以聊聊目前互联网行业的发展、AI的发展前景,等等。我希望更清晰地勾勒出,目前的AI工业界到底是什么样,以及如何选择一条更好的路。个人可以就我对科学智能之类的话题和您聊聊;其他的话题,我也会尽我所能。 欢迎来Talk!
Felix Wanyan🏄🏻‍♂️ ! Event
我买了双日学生票,但是Let‘s Vision已经逛的差不多了。明天等同学来一块聊聊~ 正在大棚排队中,也许这也是一个固定环节了吧。整体来说我觉得今年的app都更加“务实”,更注重解决一个客观存在的痛点,也真的非常insightful。讲座也非常有用,我听得比上课要认真…… 期待和大家线下见面!等待捕捉中……
Felix Wanyan🏄🏻‍♂️ ! Event
喜欢与Bonjour再相遇! 欢迎老朋友新朋友在Let‘s Vision 26面基!
Felix Wanyan🏄🏻‍♂️ ! Event
下周去Let‘s Vision 26! 最开始也是和Bonjour在这个平台相遇。期待今年和大家见面~ 哦对了,欢迎面基。
Felix Wanyan☕️ Coffee Chat
最近回家了,很好奇这里有没有合肥的朋友。也许可以约coffee chat。 我是学化学的本科生,我们可以聊关于AI、校园、科技洞察,等等等等。也许你只是想找个搭子,也是ok的~
Felix Wanyan⚒️ 创造、思考,或一切
我发现自己2025年用AI工具的频次要显著高于我开始用AI工具以来任何一年,而我因为Gemini 3 Pro,现在还在想着搞定Google AI Pro学生优惠。22年的Stable Dif fusion,23年的GPT,24年的DeepSeek,2025年的Sora,个人认为都可以说是非常有代表性的产品。AI从图片生成,到语义理解、deep research、多模态生成,展现出非常恐怖的能力。有人将其视为洪水猛兽,有人认为它是珍妮纺织机。但我害怕AI让我们失语,失去独立思考的能力。 现在我们很多同学写个实验思考题都要用大模型,甚至算数据也是用大模型完成的。这的确代表了人机交互的进化,但事实是用Excel/OriginPro算要更加便捷。AI正在让我们变懒,我们习惯性相信和依赖AI的能力,AI则默认你说的是对的。在今年的全国大学生数学建模竞赛中,我们就遇到了这样的困境,最后建立的模型令人啼笑皆非,结果也不尽人意。像这样的比赛能被称之为“水赛”吗?难道用好AI就可以了吗?就算是“用好”AI都是很难的。 拥抱AI带来的未来更需要那些“基础”能力的培养,无论是线性代数,还是编程,而不是浪费时间在无用的重复上;我今年暑假曾询问一位中科院化学院士关于本科实验教学的看法,他的大意是,实验很重要,应当做,但不应该浪费大量时间在实验报告上。此外他也提到很多老师不愿意投入精力在本科教学教材的编写上,因为这的确对他们的“帽子”没啥好处。然而AI正在淘汰那些不能真正理解事物本质,不能合理判断事物真伪的人,所以这也在对我们的本科教育,乃至于基础教育提出更高的要求和挑战。
Felix Wanyan⚒️ 创造、思考,或一切
常用的某课表App被某个臭名昭著的互联网公司收购了。它曾经是个小而美的App,现在被加上了搜题功能,难免变得丑陋臃肿,安装包体积也大了不少。得闻噩耗,震惊,气愤又无奈。 大学生还是比较依赖这些课表App来从教务系统导入课程、添加到日历进行日程管理&提醒的。然而现在的教务大多是没有CalDAV日历订阅类的功能的,总是打开教务系统的移动端也有些麻烦。许多开发者都开发了课表App用于课表管理,但想找到一个不需要登录、没有广告、轻巧美观好用的App算是很难的事情。如今最后的“净土”也没了。 追溯到项目的doc和GitHub repo,它貌似以前是开发者本科期间的一个小项目,七八年时间下来,最后还是无奈卖身。最令我担心的无非是App的本质要变了:它可能侵犯用户隐私吗?(考虑到那家互联网公司侵犯用户隐私的坏名声)它也不会再那么小而美了吧? 想把App卖了变现也不难理解,这是理想与现实的碰撞与妥协吧。开源项目、独立App如何商业化,也是大家都要共同面临的挑战。至少,我不太希望看到下一个这样的App;我们应该有更多的小而美的App。

Felix Wanyan